Ultra-FineWeb-L1 openbmb
- 类型
- dataset
- 许可
- apache-2.0
- 语言
- en
- 下载量
- 148
- 点赞
- 56
- 访问
- public
- 文件
- 500
标签
- 预训练语料
- 文本数据集
- 大语言模型
- 数据处理
- 多语言
- NLP
摘要
Ultra-FineWeb-L1 是基于 Common Crawl 构建的超大规模英语网页预训练语料,包含超过 1T tokens(约11.4亿文档),覆盖2025年六个最新快照。它属于 UltraData 的 L0-L4 分级数据管理框架中的 L1 过滤层,在 FineWeb 处理流程基础上升级主文本抽取并加入启发式过滤、敏感字段替换、MinHash 去重及定制化清洗。该数据集为后续 L2 精选(Ultra-FineWeb-classifier 分类)和 L3 精炼提供基础,适合用于大语言模型的预训练与基础语料构建。
README
--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…