OpenAI News·· 2023-05-31精选AI 评分65
OpenAI 用过程监督提升数学推理能力
Improving mathematical reasoning with process supervision
AI 导读
OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。
推荐理由
OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。
来源:OpenAI News · openai.com