跳到正文
10月4日周日
7月27日周一
  1. Import AI62

    Epoch 与 METR 发布 MirrorCode 长周期编程基准

    Epoch 与 METR 发布 MirrorCode 基准,考察 AI 仅凭 CLI 访问重新实现软件程序的能力,覆盖 25 个目标程序。Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务,17/25 的目标程序至少有一次满分运行,但 8/25 从未达到 100% 阈值,ruff、giac_subset 和 mailauth 最难。

7月8日周三
7月1日周三
3月19日周四
2月26日周四
2月23日周一
  1. OpenAI News60

    OpenAI 解释为何不再评测 SWE-bench Verified

    OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。

    推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。

10月7日周二
  1. Hugging Face Blog60

    BigCode 发布 BigCodeArena:通过代码执行端到端评测代码生成模型

    BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评测代码生成模型的人类参与平台,用户可提交编程任务、对比两个模型的生成结果并运行代码后投票。

    推荐理由:BigCodeArena 把代码执行结果引入人类投票评测,读者可据此了解代码模型评测为何需要运行而非只看源码。

8月1日周五
3月12日周三
  1. Hugging Face Blog62

    Open R1 更新第三期:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型

    Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。

    推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。

2月18日周二
8月13日周二
  1. OpenAI News60

    OpenAI 发布 SWE-bench Verified

    OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。

    推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于更可靠地比较模型解决真实软件问题的能力。

6月18日周二
4月16日周二