DeepSeek-V4-Flash-Vision-Exp deepseek-ai
- 유형
- model
- 라이선스
- mit
- 태스크
- image-text-to-text
- 프레임워크
- transformers
- 다운로드
- 0
- 좋아요
- 259
- 파라미터 수
- 304,646,824,126
- 접근
- public
- 파일
- 84
태그
- 비전언어모델
- 다중모달
- 대형언어모델
- 이미지 이해
- 에이전트
- MoE
- 코드 생성
- transformers
요약
DeepSeek-V4-Flash 아키텍처에 시각 모듈을 추가하고 계속 학습시켜 시각 이해 능력을 갖춘 실험적 멀티모달 모델입니다. 텍스트 에이전트 성능을 유지하면서 멀티모달 에이전트 역량을 크게 개선했으며, 다중 에이전트 벤치마크 ApexBench, Chartography 등에서 우수한 성능을 보여줍니다. MoE 구조와 DFlash 어텐션을 비롯한 경량 추론 구현을 제공하며, OpenAI 스타일 메시지와 <image> 태그 프롬프트 인코딩을 모두 지원합니다. 에이전트 구동 시각 언어 모델 및 데이터 분석 등에 적합합니다.
README
--- license: mit library_name: transformers pipeline_tag: image-text-to-text --- # DeepSeek-V4-Flash-Vision-Exp <!-- markdownlint-disable first-line-h1 --> <!-- markdownlint-disable html --> <!-- markdownlint-disable no-duplicate-header --> <div align="center"> <img src="https://github.com/deepseek…