跳到正文
Hugging Face Blog·· 2025-08-21精选AI 评分60

NVIDIA 发布 600 万多语言推理数据集 Nemotron Post-Training Dataset V2

NVIDIA Releases 6 Million Multi-Lingual Reasoning Dataset

AI 导读

NVIDIA 发布 Nemotron Post-Training Dataset V2,将英文推理数据翻译为法语、西班牙语、德语、意大利语和日语五种语言,规模约 600 万条。

推荐理由

NVIDIA 公开了多语言推理数据集的构建流程与过滤细节,可据此判断合成后训练数据的翻译质量风险。

来源:Hugging Face Blog · huggingface.co