DeepSeek-V4-Flash-Vision-Exp deepseek-ai

类型
model
许可
mit
任务
image-text-to-text
框架
transformers
下载量
0
点赞
259
参数量
304,646,824,126
访问
public
文件
84

标签

  • 多模态
  • 视觉语言模型
  • 视觉问答
  • 图像理解
  • Agent
  • 大语言模型
  • 混合专家
  • transformers

摘要

DeepSeek-V4-Flash-Vision-Exp 是基于 DeepSeek-V4-Flash 架构新增视觉模块并进行持续训练的实验性多模态模型,解锁了视觉理解能力。相较纯文本版本,它在多模态代理基准上大幅提升,同时保持相近的纯文本代理表现,覆盖终端、代码仓库、工具调用等场景。仓库提供视觉编码器、对齐器、MoE 与推理参考实现,支持 OpenAI 风格消息及其紧凑图像路径文本两种提示编码方式,适合多模态智能体与视觉理解应用。

README

--- license: mit library_name: transformers pipeline_tag: image-text-to-text --- # DeepSeek-V4-Flash-Vision-Exp <!-- markdownlint-disable first-line-h1 --> <!-- markdownlint-disable html --> <!-- markdownlint-disable no-duplicate-header --> <div align="center"> <img src="https://github.com/deepseek…

查看完整页面 · 查看原文