Ultra-FineWeb-L1 openbmb

Typ
dataset
Lizenz
apache-2.0
Sprache
en
Downloads
1,343
Likes
113
Zugriff
public
Dateien
500

Tags

  • Vortrainingskorpus
  • Webdaten
  • Englisch
  • Deduplizierung
  • Textdaten
  • Große Sprachmodelle
  • Pre-Training
  • Textgenerierung

Zusammenfassung

Ultra-FineWeb-L1 ist ein großskaliger englischer Webkorpus aus Common Crawl-Snapshots und dient als L1-Filterschicht im L0-L4-Datenmanagement-Framework. Er löst das Problem der Datenqualität im Pre-Training durch Haupttext-Extraktion, Sprachfilterung, heuristische Filterung, MinHash-Deduplizierung …

README

--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…

查看完整页面 · 查看原文