DeepSeek-V4-Flash-Vision-Exp deepseek-ai
- Tipo
- model
- Licencia
- mit
- Tarea
- image-text-to-text
- Framework
- transformers
- Descargas
- 0
- Me gusta
- 259
- Parámetros
- 304,646,824,126
- Acceso
- public
- Archivos
- 84
Etiquetas
- multimodal
- modelo de lenguaje
- visión por computadora
- agente
- LLM
- transformers
- razonamiento
- generación de texto
Resumen
DeepSeek-V4-Flash-Vision-Exp es el primer modelo multimodal experimental de la familia DeepSeek-V4, que incorpora módulos visuales sobre la arquitectura V4-Flash para desbloquear comprensión visual. Mejora sustancialmente las capacidades de agente multimodal manteniendo un rendimiento comparable en…
README
--- license: mit library_name: transformers pipeline_tag: image-text-to-text --- # DeepSeek-V4-Flash-Vision-Exp <!-- markdownlint-disable first-line-h1 --> <!-- markdownlint-disable html --> <!-- markdownlint-disable no-duplicate-header --> <div align="center"> <img src="https://github.com/deepseek…