Ultra-FineWeb-L1 openbmb
- Typ
- dataset
- Lizenz
- apache-2.0
- Sprache
- en
- Downloads
- 1,343
- Likes
- 113
- Zugriff
- public
- Dateien
- 500
Tags
- Vortrainingskorpus
- Webdaten
- Englisch
- Deduplizierung
- Textdaten
- Große Sprachmodelle
- Pre-Training
- Textgenerierung
Zusammenfassung
Ultra-FineWeb-L1 ist ein großskaliger englischer Webkorpus aus Common Crawl-Snapshots und dient als L1-Filterschicht im L0-L4-Datenmanagement-Framework. Er löst das Problem der Datenqualität im Pre-Training durch Haupttext-Extraktion, Sprachfilterung, heuristische Filterung, MinHash-Deduplizierung …
README
--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…