跳到正文
Hugging Face Blog·· 2024-03-20精选AI 评分60

Hugging Face 发布 Cosmopedia:如何为 LLM 预训练构建大规模合成数据

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI 导读

Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于复现 Phi-1.5 的预训练数据。

推荐理由

Hugging Face 公开了构建 250 亿 token 合成预训练数据集的完整流程与代码,可供复现和迁移。

来源:Hugging Face Blog · huggingface.co