跳到正文
热点事件持续更新

研究者给四个大模型各 100 美元开发 PDF 编辑器,点几下就露馅

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月,一位研究 LLM for Code 的研究者 nielstron 用 400 美元做了一项实验:给 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个前沿模型各 100 美元预算,让它们自主开发一款用户体验极好的开源 PDF 编辑器。结果显示,几乎每个模型做出的编辑器都能被点几下就找出 bug。作者据此提出,coding agent 无法像人一样与软件交互,这是其能力短板所在。目前该实验由开源中国报道,尚无后续跟进报道,事件进展停留在这一实验结论的发布阶段。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. 开源中国
    研究者给四个大模型各 100 美元开发 PDF 编辑器,点几下就露馅

    一位研究 LLM for Code 的研究者用 400 美元做实验,给 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个前沿模型各 100 美元预算,让它们自主开发一款用户体验极好的开源 PDF 编辑器,结果几乎每个都能被点几下找出 bug。作者 nielstron 据此提出,coding agent 无法像人一样与软件交互,这是其能力短板所在。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。