Ultra-FineWeb-L1 openbmb
- 種別
- dataset
- ライセンス
- apache-2.0
- 言語
- en
- ダウンロード
- 1,343
- いいね
- 113
- アクセス
- public
- ファイル
- 500
タグ
- 事前学習コーパス
- テキストデータセット
- 英语语料
- 大規模データセット
- データキュレーション
- 大言語モデル
- 预训练
- Apache-2.0
概要
Ultra-FineWeb-L1は、Common Crawlスナップショットから構築された大規模な英語Web公開コーパスで、1兆トークン以上(約11.4億文書)を含みます。FineWebの処理パイプラインを基に、本文抽出、言語フィルタリング、ヒューリスティックフィルタリング、機密フィールド置換、MinHash重複除去、カスタムクリーニングを施したL1フィルタリング層です。OpenBMBのUltraData枠組みにおける汎用Webデータの前処理層として、大規模言語モデルの事前学習用データに最適です。
README
--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…