DeepSeek-V4-Flash-Vision-Exp deepseek-ai
- 类型
- model
- 许可
- mit
- 任务
- image-text-to-text
- 框架
- transformers
- 下载量
- 0
- 点赞
- 259
- 参数量
- 304,646,824,126
- 访问
- public
- 文件
- 84
标签
- 多模态
- 视觉语言模型
- 视觉问答
- 图像理解
- Agent
- 大语言模型
- 混合专家
- transformers
摘要
DeepSeek-V4-Flash-Vision-Exp 是基于 DeepSeek-V4-Flash 架构新增视觉模块并进行持续训练的实验性多模态模型,解锁了视觉理解能力。相较纯文本版本,它在多模态代理基准上大幅提升,同时保持相近的纯文本代理表现,覆盖终端、代码仓库、工具调用等场景。仓库提供视觉编码器、对齐器、MoE 与推理参考实现,支持 OpenAI 风格消息及其紧凑图像路径文本两种提示编码方式,适合多模态智能体与视觉理解应用。
README
--- license: mit library_name: transformers pipeline_tag: image-text-to-text --- # DeepSeek-V4-Flash-Vision-Exp <!-- markdownlint-disable first-line-h1 --> <!-- markdownlint-disable html --> <!-- markdownlint-disable no-duplicate-header --> <div align="center"> <img src="https://github.com/deepseek…