Ultra-FineWeb-L1 openbmb

类型
dataset
许可
apache-2.0
语言
en
下载量
148
点赞
56
访问
public
文件
500

标签

  • 预训练语料
  • 文本数据集
  • 大语言模型
  • 数据处理
  • 多语言
  • NLP

摘要

Ultra-FineWeb-L1 是基于 Common Crawl 构建的超大规模英语网页预训练语料,包含超过 1T tokens(约11.4亿文档),覆盖2025年六个最新快照。它属于 UltraData 的 L0-L4 分级数据管理框架中的 L1 过滤层,在 FineWeb 处理流程基础上升级主文本抽取并加入启发式过滤、敏感字段替换、MinHash 去重及定制化清洗。该数据集为后续 L2 精选(Ultra-FineWeb-classifier 分类)和 L3 精炼提供基础,适合用于大语言模型的预训练与基础语料构建。

README

--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…

查看完整页面 · 查看原文