DeepSeek API News·· 2025-05-28精选AI 评分64
DeepSeek 将 deepseek-reasoner 升级至 DeepSeek-R1-0528
deepseek-reasoner
AI 导读
DeepSeek 将 deepseek-reasoner 模型升级至 DeepSeek-R1-0528,多项基准 Pass@1 提升:AIME 2025 从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0,LCB_v6 从 63.5 升至 73.3,Aider 从 57.0 升至 71.6。
推荐理由
DeepSeek-R1-0528 在 AIME、GPQA、Aider 等基准上的提升幅度,可用于判断推理模型迭代节奏。
正文 · AI 翻译
deepseek-reasoner 模型升级至 DeepSeek-R1-0528:
- Enhanced Reasoning Capabilities
- Significant benchmark improvements (Pass@1)
- AIME 2025:70.0 → 87.5(+17.5)
- GPQA:71.5 → 81.0(+9.5)
- LCB_v6:63.5 → 73.3(+9.8)
- Aider:57.0 → 71.6(+14.6)
- 注意:与旧版 R1 相比,复杂推理任务可能会消耗更多 token。
- Significant benchmark improvements (Pass@1)
- Optimized Front-end Development
- 生成的网页和游戏现在具有改进的美观性。
- Reduced Hallucinations
- 显著抑制了旧版 R1 中存在的幻觉问题。
- JSON Output & Function Calling Support
- Function call performance:
- Tau-bench 得分:53.5(航空)/ 63.9(零售)
- Function call performance:
来源:DeepSeek API News · api-docs.deepseek.com