GPT-5.5 实测:从编码挑战到四步生成学术论文
Sign of the future: GPT-5.5
Ethan Mollick 提前体验 GPT-5.5 后认为这是一次明显进步,他用同一个编码挑战对比 o3、Kimi K2.6 和 GPT-5.5 Pro,只有 GPT-5.5 Pro 真正模拟出随时间演变的港口城镇,且耗时从 GPT-5.4 Pro 的 33 分钟降到 20 分钟。
作者用同一编码挑战横评 o3、Kimi K2.6 与 GPT-5.5 Pro,并给出模型、应用、工具三层框架的实测差异。
我提前获得了 GPT-5.51 的使用权限,我认为这是一件大事。这是一件大事,因为它表明 AI 的快速进步还没有结束。这也是一件大事,因为它就是单纯地好用。而且这是一件大事,因为即便有这一切,AI 能力的前沿依然是参差不齐的。
随着 AI 变得越来越好,要快速展示每一代的进步变得越来越难,因为很多 AI 过去不擅长的事情,比如数学或数单词里的字母,现在对 AI 来说都是小菜一碟。所以,我会给你讲复杂的细节,但首先,举一个我认为很有说明性的简单例子。AI 模型最擅长的是编程,所以我给从 OpenAI 的第一个推理模型 o3(一年零一周前发布!)到当前最好的开放权重模型(Kimi K2.6),再到新的 GPT-5.5 Pro 这些 AI 出了一个编程挑战:“给我构建一个程序化生成的 3D 模拟,展示一个港口城镇从公元前 3000 年到公元 3000 年的演变,它应该看起来很美,并允许我对它有一些控制。”
然后我把每个答案都发布到了这个画廊里,这样你就可以亲自试验它们(实际上,我是让 GPT-5.5 Codex 帮我构建的画廊页面)。你应该玩玩它们来感受差异,但你可以在下面看到其中几个例子。除了在其他所有维度上都更好之外,只有 GPT-5.5 Pro 真正建模了一个不断演变的城镇,而不是仅仅随时间生成新的建筑替换。GPT-5.5 Pro 也比它之前的版本快得多:GPT-5.4 Pro 花了 33 分钟完成任务,GPT-5.5 Pro 只用了 20 分钟。
模型、应用和工具框架
我一直在鼓励你不要把 AI 看作单一的东西,而是看作三个相互关联的概念组成的一套体系。你需要考虑模型,比如 Opus 4.7、Gemini 3.1,或者(现在)GPT-5.5。你还要关注应用,也就是你实际用来与模型对话的产品,它们让模型能为你做真正的工作。最常见的应用是每个模型各自的网站:chatgpt.com、claude.ai、gemini.google.com。但是,像 Claude Code、Claude Cowork 和 OpenAI Codex 这样的桌面应用正日益成为最有用的 AI 应用。最后,还有工具框架,即 AI 可以使用的工具,以及 AI 模型如何与这些工具连接。工具让 AI 能够控制你的电脑、编写代码、做研究和生成图像。
OpenAI 在这三个领域都取得了进展。在模型方面,GPT-5.5 是一个强大的模型家族,其中 GPT-5.5 Pro(只能在网站上访问)能力最强。最近在应用方面也有重大进展,OpenAI 的 Codex 越来越沿着出色的 Claude Code 的道路前进,成为一个易用且实用的桌面应用。最后,还有工具框架及其可以使用的工具。有很多新的工具框架改进,但其中最有趣的之一来自 OpenAI,它有一个新的图像模型
这个新模型现在可以渲染高质量文本,并创建几乎任何你能描述出来的图片。长期读者都知道我的水獭测试,它要求 AI 生成一张水獭在飞机上用 wifi 的图片。与其再次描述它,不如让新的图像模型(有时称为 GPT-imagegen-2)替我解释:“一张水獭科学家的照片,展示 Ethan Mollick 的水獭测试结果,该测试展示了一个 AI 图像生成器能多好地生成一张水獭坐在飞机上使用 wifi 的图片”
也许你想看看关于它的学术论文?“给我展示关于水獭测试的学术论文第一页,格式良好,放在桌子上”(可以随意放大文字)
或者也许我们应该把它做成艺术?“现在展示一个精致的艺术画廊,墙上的每一幅画都是一只水獭在飞机上使用笔记本电脑,风格分别采用 Klimt、Rothko、Matisse、Monet、Picasso、Titian、Rembrandt 和 O’Keefe。每幅画下方都应有可读的标签。”(这值得放大看)
所有这些都非常酷,几个月前还不可能做到,但它也很有用。一个能够生成详细文本和图像的图像生成器,可以用来制作 PowerPoint 幻灯片、产品模型、示例网站或任何你要求的东西。但这只是一个工具,真正的魔力发生在你把 harnesses、应用和模型结合起来解决一个真实问题时。这里有一个我已经拖延了十年的问题。
把它整合起来
我是一名学者,我的许多非 AI 工作,尤其是在 2010 年代初期,都集中在众筹上。我有数百个关于该主题的匿名数据文件,这些文件来自调查、分析和研究工作,混合了 STATA、CSV、XLS 和 Word 文件,我一直没来得及写一篇关于它们的论文。我想看看 GPT-5.5 能用这些信息做到什么程度。于是,我使用由 GPT-5.5 驱动的 Codex,并问道:“帮我整理[这些数据],并生成一个可能有趣的新假设,用复杂的方法测试它,并写一篇学术论文。”我还要求它包含文献综述和格式。结果非常令人印象深刻,尤其是在我让 GPT-5.5 Pro 对论文发表评论,并将这些结果反馈给 Codex 之后。你可以在这里阅读结果。它并不完美,但这不再是因为存在明显错误:文献综述都是真实的,统计数据也是真实的。相反,是因为作为一名专家,我认为这个假设并不那么有趣,而且即使 AI 使用了非常复杂的统计方法来尝试解决,仍然存在一些关于因果关系的常见担忧。简而言之,如果这篇论文是一个二年级博士项目的成果,我会非常满意。而我只是给了它四个提示,自己从未碰过文本。
我们还可以用另一种方式把 harnesses、应用和模型结合起来。我让 Codex 创建一个全新的桌面角色扮演游戏,基本上是它自己版本的《龙与地下城》,设定在一个它自己发明的奇幻世界中,包含游玩所需的所有表格和规则。我还要求它模拟玩家体验这个游戏,并根据发现修订规则。如你所见,AI 照做了,包括排版出一份有吸引力的 101 页 PDF,并使用其图像生成器为其配图。
除了技术上很精巧之外,实际内容也有很多值得喜欢的地方。设定有趣而新颖,规则看起来也说得通,借鉴了现有的游戏模式,同时加入了独特的元素。然而,仔细审视后也会发现,AI 能力的参差边界并未完全消失。每一代 AI 模型都在真正构建长篇虚构作品上苦苦挣扎。如果你是 AI 写作的常客,你会在这里看到同样的问题:对诡异感的偏爱;过于复杂却未能完全兑现的想法;奇怪的隐喻(“天气和建筑是以不同速度进行的同一场争论”);过多华丽的句子(“当一片海忘记自己曾是一条路时浮现的神圣之物”,一次很酷,整本书都这样则令人疲惫);对话中每个角色都用同样短促的语气说话;以及“Mara”这个名字。所以,即便在所有惊人的技术进步之中,仍然存在粗糙的边缘。
GPT-5.5 向我们表明,模型越来越聪明,应用越来越强大,工具链也越来越好,使它们在解决实际问题上愈发高效。我可以通过四个提示词得到一篇接近博士水准的论文,或者通过一个提示词得到一个可玩的角色扮演游戏,配有插画并经过“试玩”。但虚构作品仍然平淡,假设有时即使统计数据可靠也乏善可陈。不过话说回来。一年前,这些都还差得远,而随着最新版本的发布,能力提升似乎正在加速。
GPT-5.5 显然不是这一进程的终点,但它是沿途一个值得注意的台阶。我写这份通讯已经三年多了,模式从未改变:每隔几个月就会有新模型到来。我跑我的测试,曾经不可能的事情变得容易,而每一次新版本发布,跃升的幅度都在增大。参差的边界依然存在。只是它比过去远得多了。
我不从 OpenAI 或任何其他 AI 实验室拿钱,OpenAI 也没有提前看过这篇文章。另外,我写这篇文章时并不了解发布的全部细节,所以如有错误,敬请谅解。
来源:One Useful Thing · oneusefulthing.org