DeepSeek-V4-Flash-Vision-Exp deepseek-ai

유형
model
라이선스
mit
태스크
image-text-to-text
프레임워크
transformers
다운로드
0
좋아요
259
파라미터 수
304,646,824,126
접근
public
파일
84

태그

  • 비전언어모델
  • 다중모달
  • 대형언어모델
  • 이미지 이해
  • 에이전트
  • MoE
  • 코드 생성
  • transformers

요약

DeepSeek-V4-Flash 아키텍처에 시각 모듈을 추가하고 계속 학습시켜 시각 이해 능력을 갖춘 실험적 멀티모달 모델입니다. 텍스트 에이전트 성능을 유지하면서 멀티모달 에이전트 역량을 크게 개선했으며, 다중 에이전트 벤치마크 ApexBench, Chartography 등에서 우수한 성능을 보여줍니다. MoE 구조와 DFlash 어텐션을 비롯한 경량 추론 구현을 제공하며, OpenAI 스타일 메시지와 <image> 태그 프롬프트 인코딩을 모두 지원합니다. 에이전트 구동 시각 언어 모델 및 데이터 분석 등에 적합합니다.

README

--- license: mit library_name: transformers pipeline_tag: image-text-to-text --- # DeepSeek-V4-Flash-Vision-Exp <!-- markdownlint-disable first-line-h1 --> <!-- markdownlint-disable html --> <!-- markdownlint-disable no-duplicate-header --> <div align="center"> <img src="https://github.com/deepseek…

查看完整页面 · 查看原文