Ultra-FineWeb-L1 openbmb
- Tipo
- dataset
- Licencia
- apache-2.0
- Lenguaje
- en
- Descargas
- 148
- Me gusta
- 56
- Acceso
- public
- Archivos
- 500
Etiquetas
- preentrenamiento de LLM
- corpus de texto
- texto web
- dataset de texto
- preentrenamiento
- NLP
- LLM
Resumen
Ultra-FineWeb-L1 es un corpus web en inglés a gran escala construido a partir de snapshots de Common Crawl de 2025, con más de 1T de tokens y ~1.140 millones de documentos. Sirve como capa L1 filtrada dentro del marco de gestión de datos por niveles L0-L4 de UltraData, aplicando extracción de texto…
README
--- language: - en license: apache-2.0 size_categories: - 1B<n<10B task_categories: - text-generation pretty_name: Ultra-FineWeb-L1 tags: - llm - pretraining - web-corpus - common-crawl - data-filtering - deduplication - fineweb - ultradata configs: - config_name: CC-MAIN-2025-30 data_files: - spli…