Ultra-FineWeb-L1 openbmb

Tipo
dataset
Licencia
apache-2.0
Lenguaje
en
Descargas
148
Me gusta
56
Acceso
public
Archivos
500

Etiquetas

  • preentrenamiento de LLM
  • corpus de texto
  • texto web
  • dataset de texto
  • preentrenamiento
  • NLP
  • LLM

Resumen

Ultra-FineWeb-L1 es un corpus web en inglés a gran escala construido a partir de snapshots de Common Crawl de 2025, con más de 1T de tokens y ~1.140 millones de documentos. Sirve como capa L1 filtrada dentro del marco de gestión de datos por niveles L0-L4 de UltraData, aplicando extracción de texto…

README

--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…

查看完整页面 · 查看原文