LEGO-Anything 用编码智能体从单张照片生成 Blender 3D 场景
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
Epoch 与 METR 发布 MirrorCode 基准,考察 AI 仅凭 CLI 访问重新实现软件程序的能力,覆盖 25 个目标程序。Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务,17/25 的目标程序至少有一次满分运行,但 8/25 从未达到 100% 阈值,ruff、giac_subset 和 mailauth 最难。
OpenAI 发布新分析,指出热门编码基准 SWE-Bench Pro 存在可靠性与准确性隐患,可能影响对 AI 模型的评测。该分析聚焦于如何从编码评测中区分有效信号与噪声。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的跨框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1,331 个专家测试。
OpenAI 采用思维链监控(chain-of-thought monitoring)研究内部编程智能体的失准(misalignment)问题,通过分析真实部署场景来检测风险并强化 AI 安全保障措施。
OpenAI 与 Pacific Northwest National Laboratory 联合推出 DraftNEPABench,用于评估 AI 编程智能体如何加速联邦许可审批。该基准显示,NEPA 文件起草时间有望最多缩短 15%,助力基础设施审查现代化。
OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。
推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。
BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评测代码生成模型的人类参与平台,用户可提交编程任务、对比两个模型的生成结果并运行代码后投票。
推荐理由:BigCodeArena 把代码执行结果引入人类投票评测,读者可据此了解代码模型评测为何需要运行而非只看源码。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成任务上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码基准。
Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。
推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成价值 100 万美元的真实自由职业软件工程任务。该基准以真实外包项目为题目,考察模型在实战软件工程中的能力与变现潜力。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于更可靠地比较模型解决真实软件问题的能力。
Hugging Face 发布 BigCodeBench,包含 1140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每项任务平均 5.6 个测试用例、分支覆盖率 99%。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估检测并防止数据污染。