Qwen3.8-Flash-Next Qwen

유형
model
라이선스
other
태스크
image-text-to-text
프레임워크
transformers
다운로드
2,551
좋아요
3,375
파라미터 수
179,999,981,459
접근
public
파일
144

태그

  • 멀티모달
  • 대형 언어 모델
  • 하이브리드LLM
  • MoE
  • 장문 컨텍스트
  • 추론 배포
  • transformers
  • SGLang

요약

Qwen3.8-Flash-Next는 Qwen4의 기반이 될 실험적 스파스 하이브리드 어텐션 아키텍처를 공개한 인과 언어모델이며 비전 인코더를 탑재한 멀티모달 모델입니다. Gated DeltaNet과 Qwen Sparse Attention(QSA) 결합, Gated Residual, N-gram 임베딩, MoE 구조(512 전문가)로 125B 파라미터 중 6B만 활성화해 장문 컨텍스트 저지연 추론과 메모리 효율적 스케일링을 지향합니다. 기본 262K, 최대 1M 토큰 컨텍스트로 에이전트 워크로드와 같이 대규모·장문 작업에 적합하며 …

README

--- library_name: transformers license: other license_name: qwen-community-1.0 license_link: LICENSE pipeline_tag: image-text-to-text --- # Qwen3.8-Flash-Next > [!Note] > 이 저장소는 Hugging Face Transformers 형식의 사후 학습(post-trained) 모델에 대한 가중치와 설정 파일을 포함하고 있습니다. > > 이러한 아티팩트는 Hugging Face Transformers, …

查看完整页面 · 查看原文