跳到正文
原文
Hugging Face Blog·· 2024-03-20精选AI 评分80

Hugging Face 开源 Cosmopedia 合成数据集及生成工具

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI 导读

Hugging Face 发布 Cosmopedia,这是目前最大的开源合成数据集,包含250亿token和3000万个文件,由 Mixtral-8x7B-Instruct-v0.1 生成。Hugging Face 开源了端到端生成代码、数据集以及基于此训练的 1B 模型 cosmo-1b,详细披露了通过提示词工程和 Web 数据聚类构建大规模预训练数据的完整技术栈。

推荐理由

开源了250亿token合成数据及生成代码,为复现Phi模型提供了可迁移的预训练数据构建方案。

来源:Hugging Face Blog · huggingface.co