Ultra-FineWeb-L1 openbmb
- 유형
- dataset
- 라이선스
- apache-2.0
- 언어
- en
- 다운로드
- 1,343
- 좋아요
- 113
- 접근
- public
- 파일
- 500
태그
- 사전학습 말뭉치
- 데이터 필터링
- 대규모 데이터셋
- 영문 말뭉치
- 웹 코퍼스
- 텍스트 데이터셋
- 데이터 전처리
요약
Ultra-FineWeb-L1은 Common Crawl 스냅샷에서 구축한 대규모 영어 웹 코퍼스로, UltraData의 L0-L4 계층 데이터 관리 프레임워크에서 L1 필터링 계층을 담당합니다. 본문 추출, 언어·휴리스틱 필터링, 민감정보 치환, MinHash 중복 제거 등 파이프라인을 거쳐 약 11.4억 개 문서(1조+토큰)로 구성됩니다. 대규모 언어 모델의 사전학습용 고품질 웹 코퍼스로 활용됩니다.
README
--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…