DeepSeek-V4-Flash-Vision-Exp deepseek-ai

Tipo
model
Licencia
mit
Tarea
image-text-to-text
Framework
transformers
Descargas
0
Me gusta
259
Parámetros
304,646,824,126
Acceso
public
Archivos
84

Etiquetas

  • multimodal
  • modelo de lenguaje
  • visión por computadora
  • agente
  • LLM
  • transformers
  • razonamiento
  • generación de texto

Resumen

DeepSeek-V4-Flash-Vision-Exp es el primer modelo multimodal experimental de la familia DeepSeek-V4, que incorpora módulos visuales sobre la arquitectura V4-Flash para desbloquear comprensión visual. Mejora sustancialmente las capacidades de agente multimodal manteniendo un rendimiento comparable en…

README

--- license: mit library_name: transformers pipeline_tag: image-text-to-text --- # DeepSeek-V4-Flash-Vision-Exp <!-- markdownlint-disable first-line-h1 --> <!-- markdownlint-disable html --> <!-- markdownlint-disable no-duplicate-header --> <div align="center"> <img src="https://github.com/deepseek…

查看完整页面 · 查看原文