Ultra-FineWeb-L1 openbmb

種別
dataset
ライセンス
apache-2.0
言語
en
ダウンロード
1,343
いいね
113
アクセス
public
ファイル
500

タグ

  • 事前学習コーパス
  • テキストデータセット
  • 英语语料
  • 大規模データセット
  • データキュレーション
  • 大言語モデル
  • 预训练
  • Apache-2.0

概要

Ultra-FineWeb-L1は、Common Crawlスナップショットから構築された大規模な英語Web公開コーパスで、1兆トークン以上(約11.4億文書)を含みます。FineWebの処理パイプラインを基に、本文抽出、言語フィルタリング、ヒューリスティックフィルタリング、機密フィールド置換、MinHash重複除去、カスタムクリーニングを施したL1フィルタリング層です。OpenBMBのUltraData枠組みにおける汎用Webデータの前処理層として、大規模言語モデルの事前学習用データに最適です。

README

--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…

查看完整页面 · 查看原文