Hugging Face Blog·· 2025-08-21精选AI 评分60
NVIDIA 发布 600 万多语言推理数据集 Nemotron Post-Training Dataset V2
NVIDIA Releases 6 Million Multi-Lingual Reasoning Dataset
AI 导读
NVIDIA 发布 Nemotron Post-Training Dataset V2,将英文推理数据翻译为法语、西班牙语、德语、意大利语和日语五种语言,规模约 600 万条。
推荐理由
NVIDIA 公开了多语言推理数据集的构建流程与过滤细节,可据此判断合成后训练数据的翻译质量风险。
来源:Hugging Face Blog · huggingface.co