Ultra-FineWeb-L1 openbmb

유형
dataset
라이선스
apache-2.0
언어
en
다운로드
1,343
좋아요
113
접근
public
파일
500

태그

  • 사전학습 말뭉치
  • 데이터 필터링
  • 대규모 데이터셋
  • 영문 말뭉치
  • 웹 코퍼스
  • 텍스트 데이터셋
  • 데이터 전처리

요약

Ultra-FineWeb-L1은 Common Crawl 스냅샷에서 구축한 대규모 영어 웹 코퍼스로, UltraData의 L0-L4 계층 데이터 관리 프레임워크에서 L1 필터링 계층을 담당합니다. 본문 추출, 언어·휴리스틱 필터링, 민감정보 치환, MinHash 중복 제거 등 파이프라인을 거쳐 약 11.4억 개 문서(1조+토큰)로 구성됩니다. 대규모 언어 모델의 사전학습용 고품질 웹 코퍼스로 활용됩니다.

README

--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…

查看完整页面 · 查看原文