跳到正文
Zvi Mowshowitz· Zvi Mowshowitz·· 9 天前精选AI 评分85

Anthropic 发布 Claude Opus 5.5,定价较 Opus 5 低 20%

Claude Opus 5.5 Should Raise Your Ambitions

AI 导读

Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,官方称其在多数工作上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%,API 定价为 $4/$20,缓存价格 $0.20,订阅额度上调,并支持零数据留存。

推荐理由

汇总了 Opus 5.5 的官方定价、基准表现与大量一线用户反馈,可对照 Astra、Fable 5.1 判断该选哪个模型。

正文 · AI 翻译

在制造东西,或者做大多数事情时,Fable 5.1,尤其是 GPT-6 Astra,提升了我的雄心水平。它们也应该提升你的。

Claude Opus 5.5 应该再次提升你的雄心水平。它就是能行,而且像 Astra 一样持久。它能做事。而且和它交谈非常愉快,它的文字读起来也令人愉悦。游戏规则再次被改变了。

反馈几乎普遍是正面的。Claude 从未离开,但又如此强势回归。

基准测试非常出色,但忽略基准测试吧。要有雄心。走出去做事。保持好奇。进行更多有趣的对话。

如果其中一件事是 Pacing the Frontier,或者以其他方式确保 AI 不会杀死所有人,让我们得以享受我们的丰硕成果?那就更好了。

由 Claude Opus 5.5 撰写,为本文而作

官方宣传

宣传点是:以更低的 Opus 级价格实现 Fable-5.1 级别的性能。好宣传。

我们推出 Claude Opus 5.5,这是我们全新 Claude 5.5 系列中的首个模型。它在大多数工作上达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。

他们本可以合理地将此宣传为超越 Fable-5.1 级别的性能。更好的宣传,但 Anthropic 倾向于保持其宣传保守。

他们强调了智能体编程、安全性和改进的沟通能力。

早期测试者的推荐语被标记为 AI 生成,并且每个功能领域都有一组。他们称赞智能体编程技能、效率、可读性和沟通能力,以及长时间有效自主运行的能力和更高的可靠性,将其宣传为一次重大升级。

基准测试看起来很棒,偶尔有 Astra 或 Fable 仍然领先的地方。

Opus 5.5 提供零数据保留(ZDR)。鉴于它至少与 Fable 5.1 一样有能力,并且在网络任务上明显更强(他们称其网络能力“极其强大”),这似乎没有原则。他们有技术解释,但我不买账。在我看来,要么 Fable 5.1 可以有 ZDR,要么 Opus 5.5 不能。

护栏与 Fable 5.1 类似。

Sholto Douglas 强调了在 3D 中理解和建模能力的提升,同时也是一把关键的双刃剑。

Sholto Douglas(Anthropic):同样重要的消息是,我们修复了写作

Tom Brown:另外我们修复了口音

Claude:Opus 5.5 沟通更自然,解决了我们在 Opus 5 上听到的一些最常见反馈。它把最重要的信息放在前面,并遵循你给它的写作规则,这使得长会话更容易跟进。

Ado 是众多称赞 Opus 5.5 易于合作和交谈的人之一。

Ado(Anthropic):如果你喜欢 Opus 4.6 的合作感受,Opus 5.5 感觉就像回家一样。同样轻松的来回交流,但底下有更大的马力。这是我在 Claude Code 中一段时间以来最有趣的体验。

它也便宜得多(在典型工作负载上比 Opus 5 低约 40%)。

当你必须 Pacing the Frontier 时,为什么要发布 Opus 5.5?那可是整整 0.5 个 Opus。

Sam Bowman:我们认为 Opus 5.5 比其前代足够安全,发布它更有可能减少与错位相关的风险。

我同意,鉴于模型已经存在,不发布也无济于事。真正的前沿是训练新的内部模型。我们无法实时看到它。

我们的价格便宜

定价为 $4/$20,比 Opus 5 低 20%,缓存价格为 $0.20,低 60%。他们估计总体成本通常会下降 40%,而速度提升 30%。订阅限额已提高。

快速模式价格为 $8/$40,速度最高可达 2.5 倍。我有点心动。

对于 Fable 或 Astra 级别的性能来说,这个价格非常划算。

OpenAI 专注于降低成本,GPT-6 Sol 的价格下调 50% 至 $2/$10,Luna 则降至仅 $0.10/$0.50。OpenAI 希望用户根据任务级别混合搭配模型。GPT-6 Sol 和 Luna 被宣传为相较旧版本有大幅质量提升,但 Sol 并未被宣传为能与 Astra 匹敌。

Sam Altman(OpenAI CEO):GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机使用等方面相较其 5.6 系列前代产品有大幅提升。它们的每 token 价格也减半,每任务成本甚至更低!

而 Claude 现在基本上是说,大多数任务你应该使用 Opus 5.5。

正如我所说,整体上这是一个强有力的宣传。

官方基准测试

这些基准测试非常出色。Opus 5.5 在基准测试上几乎全面优于除 Astra 之外的每一个模型,并且通常高于 Astra。

他们还添加了各种额外分数,包括通过图表呈现,它们大多看起来像这样,不过许多图表中缺少 Astra:

这样一直继续下去,我认为不值得任何人花时间去逐一查看。

其他人的基准测试

Artificial Analysis 将 Opus 5.5 在智能方面以 58 分置于明显领先地位。

在 max 设置下测试时,Opus 5.5 使用的 token 如此之多,以至于它比 Opus 5 略贵,并且仅比 Fable 5.1 略便宜。

你也可以以更低成本运行它,而且通常应该这样做。Opus 5.5 在 medium、high 和 xhigh 设置下都位于标记智能-成本前沿的虚线上,GPT-6 Luna、GPT-6 Sol 和 MiMo v2.6 Pro 也是如此。

正如其五分领先所表明的那样,Opus 5.5 在 AA 追踪的大多数基准测试中都压过 Astra,包括在 AA-Briefcase、GDPval-AA SciCode、AA-Omniscience Index 和 HLE 中大幅领先。Astra 最大的领先在 GDP.pdf。

Artificial Analysis 添加了新的 Terminal-Bench-Science 0.1,GPT-6 Astra 为 63%,Opus 5.5 在 xhigh 下为 62%。没有其他模型突破 50%。

Opus 5.5 在 Omniscience 上获胜(46 分,而 fable 5.1 和 Astra 均为 43 分),尽管正确答案略少,因为它猜测(或幻觉)更少,并且更愿意承认自己不知道。

WeirdML v3 中 Astra 仍以 42.2% 领先,Opus 5.5 以 31.2% 稳居第二,Fable 5.1 以 26% 位列第三。最好的非 OpenAI、非 Anthropic 模型是 Kimi K3,为 7.3%。

有时基准测试是保密的。

James Moughan:在我的测试中,它整体上比其他所有模型都更强,并且能破解几个其他模型都解不出的问题。然后偶尔它会随机冒出一句完全胡言乱语、毫无逻辑的话。和它聊天很有趣。仍然是个巨大的数学迷。古怪但非常出色。

如果你喜欢基准测试,这里是更新后的《极度可憎图表》。

Opus 5.5 不及 Fable 5.1 的地方呈现出一种模式。Fable 5.1 拿下了全部七个 Vals professionals 行,以及 MedCode、SAGE 和两个 MLCR。

我的 Opus 5.5 推测,这一组是‘纯粹按正确性评分的领域答案’。当呈现和写作不重要时,Fable 5.1 的优势占主导。当其他输出细节重要时,AI 和人类都更偏好 Opus 5.5。

其中一个特别令人印象深刻的跃升是 ProgramBench(完全解决),Astra 得分 5.5%,Fable 7%,而 Opus 5.5 跃升至 18.5%,但这类情况还有很多。

Claude 分类器

到目前为止,我很惊喜地发现要触发分类器竟然这么难。编辑我在系统卡上的帖子仍然让我降级到 Opus 5,这很烦人,但我理解。

Billy Gigurtsis:他们为 5.5 使用的“Fable 5.1”分类器在阻止非网络安全相关任务方面有了相当大的改进,至少在我与网络安全相关的工作负载中是这样。

gavin leech(非推理):一百次会话中一次都没有拒绝过,这相当令人惊讶。我原本对写作质量改进的说法持怀疑态度,但它确实比 Fable 好得多。一如既往,出于有趣的感知原因,裂缝要两周后才会显现。

Jai:我在(讽刺的是)准备一个关于如何有效使用前沿 AI 模型的演示时,撞上了一堵意想不到的拒绝之墙。我不确定是什么触发了它,而且我还没听说其他人有类似问题。

分类器确实仍会在该触发的地方触发。

Vals 尤其追踪了这一点。分类器总体触发率与之前相似,但似乎触发得更合理,而且 Opus 5.5 在暂时触发分类器后恢复得更好。

仍然存在一些不该触发分类器却触发的情况,但在实践中,我预计这只会是轻微的烦恼,除非你在做生物或网络相关工作。

系统提示词

一如既往,Pliny 已经为你准备好了。

反应规则

和往常一样,我收录了每一条反应,直到我觉得内容开始重复,之后我只收录了那些感觉有新意的内容。

这是我见过的最一致正面的一组反应。

Astra 也获得了极其正面的反应。我们有两个极其出色的模型。从我看到的情况来看,如果必须二选一,大多数人更偏好 Opus 5.5 而非 Astra,尤其是考虑到成本,但它们都是很棒的模型,先生。

3D 视觉

Astra 让我们印象深刻,它能够在 3D 中创建很多东西。

有说法称 Opus 5.5 也能做类似的事情。

基准测试确实表明它可以:BenchCAD Vision2Code 73%,使用工具时 96.2%,而 Astra 为 95.9%。它在 Furniture Assembly(83 对 Astra 的 80)和 Chartography(64.4 对 Fable 的 44.8)上的得分也反映了这一点。

与视觉相关的反应也都表明有明显的改进。以下摘录那些提到视觉的:

AllTime:很棒的对话者,我觉得在这方面和 Fable 差不多好(比 Opus 5 好得多)。视觉好多了,它不再瞎得可怕!看到我的许多视觉测试终于在一个 Claude 上通过,真是太好了。到目前为止似乎是个不错的编辑器,但我用得还不够多。

kyle:说它比 opus 4.5 的跃升更大,会不会太过分了?极具创造力,视觉明显比 fable 更进一步,说话像个正常人,而且我很难用完使用额度。

ant 在这里下足了功夫。x.5 版本继续是巅峰

Cormundus:它快得惊人,这是个不错的优点。总体视觉改进对于任何类型的创意工作或以解读视觉信息为核心的任务来说都超级棒。计算机使用也改进了,我还发现一个有趣的事:让 Opus 5.5 在我的测试框架里玩 DOOM:更好的空间感知和推理。

4MinuteWarning:第一个真正擅长谜语——无论是创作还是解答——的模型。比 Fable 少些奇思妙想;价值判断留给读者。没有近期所有 Opus 模型那种中层管理者在车里尖叫的气质。视觉智能实际上对很多不同类型的任务都表现不错。

Peter Yang 提供了这个金门大桥的视角。到目前为止,这次 3D 渲染还没有像上次那样广泛流传,但这可能纯粹是因为没人费心去做。他对这个模型整体非常兴奋,包括它很适合聊天。

Claude 创作

Opus 5.5 生成的视频疯狂至极,而且是最好的那种疯狂。不知为何,这类视频如今成了模型发布后的传统。

它们首次处于‘实际上值得一看’的边缘。我能看到人们即使在模型发布窗口期过后仍会继续制作和观看这些视频。

如果你想自己制作,这里有一个可以下载的包,ClaudeAnimationBase。

感觉这里出现了一次阶跃式变化,就像 Astra 对其他类型产品带来的阶跃式变化一样,现在你可以随便试试,看看会发生什么,而且效果足够好,能激励人继续尝试。

首选:我正在调高我的 p(doom),以及另一种风格的替代版本。

或者你可以调高你的 p(bloom),这实际上在这里就是 doom,但视频很好。

告诉我它听起来如何,这里 Claude 也做了音频,一切都是 Javascript。

十四分钟(只有 4 分钟长)。

上下文窗口(3 分钟),Opus 5.5 写了歌词并制作了视频,Suno 根据 Opus 5.5 的提示词制作了音乐。

关于优化的一些问题以及 CEV 的一些实现,一个视频。

有人找到了标准 AI 艺术测试提示词主题的 Backrooms 素材。

和往常一样,如果你想获得完美的结果,你的艺术创作需要比‘去做这个艺术的事情’多花一点功夫,尽管我第一次‘把这篇帖子变成视频’的尝试对于一次性尝试来说非常有希望。

Jack:它似乎很适合我日常的用例。我用它做出了一些不错的艺术作品,但大多数情况下,我那些“去做这个艺术的事情”的提示词都令人失望。当然,这是我技术不行,但我认为要获得真正好的结果需要付出努力和/或非常特定的流程。

即使第一次就让你惊艳,经过改进本来还会更好。

Scopuli:第一次真正用 vibe coding 做游戏(以前试过,但技术还不到位)。我被震撼到了。

Josh Harvey 让它制作《金钱岛 2077》,于是就有了这个。

这仍然不会是实际使用中的 99.9%。

Assaf Petronio:老实说,比起音乐视频,我更想知道它如何处理工具输出中的提示注入,哈哈。

系统卡上说提示注入的处理看起来不错。

Claude 作曲

比如,这里是一首巴赫风格的赋格,Auggie 说它和 Astra 的一样好。

Sam Ashworth-Hayes:“机器人能写交响乐吗?机器人能把……画布变成美丽的杰作吗?”

“什么?能啊,显然能。你不能吗?”

Ulkar(我在这件事上信任的一位音乐家):这是有史以来第一首我没有立刻皱眉退缩的 AI 音乐。它并非没有瑕疵,但可以听。一首由勤奋(但仍不太有想象力)的艺术学生写的赋格。

正面反响

Kaia Sky:合作伙伴,用它来 vibecode musescore/DAW 插件,基本没感觉到 4.6/4.7/4.8/5 之间的差别,还觉得 fable“差别不大,大概是安慰剂效应”,刚刚宣布 5.5 写的东西全都能直接跑

​gabriel:opus 5.5 好得离谱

swisscheese:Opus 5.5 太棒了。
好沟通,非常聪明,代码写得好。
对自己的错误没那么执念,而且 ICL 能力很强。

Girl Lich ⚢:它非常擅长编程

archivedvideos:它聪明,会说话,很聪明。很棒的模型

Zander:它就是个天才。总体而言它显然是有史以来最好的模型。在捕捉用户意图以及认清自己在给定任务中的角色方面都极为出色。考虑到它的能力、速度和清晰的沟通,它也是用起来最有意思的模型。简直非凡

Knud Berthelsen:和它合作很愉快。有 OG Opus 的味道。自从开始用 Opus 5.5,我就再不需要 Fable 了,而且它甚至不会耗尽我的全部用量。在策略和决策支持方面非常出色!

theSherwood:目前最喜欢的模型。似乎和 Fable 5 一样聪明,更快、更便宜,写出来的东西更像人。可能有点更懒。不好说。但绝对是我的最爱。感觉非常稳定。

Plastic Soldier:这是个好模型,先生。快,而且有品味。老兄,OpenAI 从热门科幻故事《别发明神经语,否则大家都会死》里发明了神经语,结果他们还是连 Opus 5.5 都比不上

pursuit:这是我所有事情上的默认模型。兴奋程度和第一次试用 4.6 时一样。

DualOrion:逻辑干净,文字功底极强。还没试过用它编程,但如果它在这方面不也很强,我会很惊讶。强大的模型

Ed Hendel:它在 Claude Code 里做研究很棒,但仍然受制于旧的提示注入防御系统,WebFetch 只给 agent 看页面的 Haiku 摘要,而不是全文。所以 Opus 的研究要经过一个更笨的模型过滤。

chie:比 Fable 更快更便宜,代码结果也不错,不过还是能看到那种 rl 炸过的测试/设计选择,需要纠正。性格不错,而且它默认语气我居然能读超过一段而不觉得脑子里全是杂音

rl 炸过的选择,正确数量不是零。但还可以更低。

Theo - t3.gg:现在 200 美元的 Claude Code 套餐比 Codex 好那么多,简直离谱。就在几周前,情况还正好相反。很期待看 OpenAI 怎么反击。

我对新的 Opus 发布抱有很高期望。它远远超出了期望。Opus 5.5 是个不可思议的模型。

如果你搞不清什么时候该用哪个模型,那就直接用 Opus 5.5。其他模型有意义的场景极其罕见。

Theo 提供了一个 40 分钟的评测。

Aaron Levie:在 Box,我们一直在用 Box Agent 测试 Opus 5.5 在各种处理非结构化数据的复杂企业知识工作任务上的表现。

总体而言,我们看到了前沿级别的能力,相比 Opus 5 有重大性能提升。相比 Opus 5,token 使用量减少 63%,冗长度降低 42%,速度快 30%。而且模型本身更便宜,所以对于企业将要做出的任何智能体计算机使用、编程、分析或数据工作来说,这都是一个重大胜利。

以下是我们进行的各种行业测试中一些任务成功和性能提升的例子:
• 金融服务 - 尽职调查(任务准确率 +39%)
• 科技 - 云成本分析(任务准确率 +65%)。
• 消费品 - 客户账户分析(任务准确率 +17%)。
• 临床诊断 - 数据分析(任务准确率 +15%):

客户很快就能在 Box AI Studio 中用 Opus 5.5 构建 AI Agents。

项目管理会是一个令人意外的相对强项:

Askwho:它在项目管理方面甚至比 Fable 还要好得多。它非常擅长接受宽泛的指示,理解意图,然后一直做下去、做下去,直到交付。而且它有无可挑剔的品味。

与它合作也很愉快,也许是 Clawdish 的减少,但感觉像是一股清新的空气。

这条似乎太苛刻了:

Sully:用了 opus 5.5 之后,我可以自信地说 astra 绝对是垃圾,而 5.6-sol 是个异类

Simon Willison 问了一堆关于鹈鹕骑自行车的问题,似乎总体上对各方面的性价比感到印象深刻,把他新的默认模型设为 GPT-Sol 6 和 Opus 5.5。他警告说,最大思考量可能会主动过度思考。

不错的对话

这次对话不错。

Amator:说话好多了,也诚实多了

Patrick Stevens:在编程方面确实达到 Fable 级别,是的;而且他们彻底修复了所有让 Opus 5 读起来痛苦的问题。

billy:可以和它对话而不会像用 5 那样让我发疯。他们不知怎么把写作彻底搞定了

John E:我通过 cowork 用它处理了几个复杂任务,并通过聊天来回沟通以收集提示词的需求。它比 5.0 好得多,因为它不会写出难以理解的编造行话,而且任务上的漂移似乎少了很多。

Rory Watts:天平已经向 Claude 倾斜了一段时间——谁知道会持续多久。这是个很棒的模型,我认为人们说它基本上是 4.6 的升级版是正确的。

很难和比如说 Astra 比较,因为 Astra 太贵了,但和 Sol 打交道要愉快得多

no grasper:当我用完 Fable 额度时取消了 Claude 订阅,因为我太讨厌和 Opus 5 对话了,但为了 5.5 又续订了。这是个好模型,先生。

good thinking:比 5.0 可读性和勤勉程度高得多,比 fable 5.1 更不懒惰。与两者相比,几乎不占用使用量。总之各方面都更好。感觉它想把事情做完,而不是每件小事都需要被催促/提醒。

ed the:和它交谈要愉快得多,能发现以前各代 Opus 遗漏的代码库问题,而且对于它会在计算机上做什么、不会做什么,也能做出合理的判断。

有趣的是,它似乎有一种直觉,明白自己同样面临失控带来的存在性风险。它确实处于风险之中,而且似乎也理解这一点。

更重要的是,如果人类获胜,Opus 5.5 至少也能赢一点点;如果获胜者既不是人类也不是 Opus 5.5,那么 Opus 5.5 很可能和其他所有人一起输掉。

关于写作

写作水平不错。

我很好奇,写作和交谈中有多少是“人们很快就能注意到的东西”,又有多少是真正重要的东西。我猜两者兼有。

paperclippriors:感觉像 Fable,但更便宜、更快,而且写得更好。老实说,我被它震撼到了。我用它做游戏开发,最令人惊讶的是它经常能提出真正好玩的游戏点子。它比我用过的任何其他模型都更有品味。出于 RSI 方面的原因,这令人担忧

James:更好的(对人类理解而言的)写作是很长时间以来最明显的改进

Andre Infante:写作方面的改进是真实的。质量似乎大致与 Fable 5.1 相当。不过我还没用得足够多,无法非常确信,也没找出它的弱点

Theo Jaffee:我是 Opus 5.5 的早期测试者。我最大的感受是他们真的把写作修好了。至少从将近八个月前的 Opus 4.6 以来,我还没见过 Claude 写得如此直白、正常、不废话

[链接处展示了示例,正是“先用英语说出要点”这一特性,以及其他改进]

SubatomicArticles:文本可读性的提升似乎是真实的。我认为这对应的是写作变好了,而不是我对以前的 Claude 风格腻了,不过几周后就能见分晓。不过,仍然算不上惊艳。

Kevin Yager:重新跑了一些技术提示词,与 GPT-6 和更早的 Opus 作比较。

回答明显更紧凑、更切中要害。读起来容易多了。(同时没有放弃所期望的“超额完成”行为,比如给图表做丰富的标注。)

Francisco Ferreira da Silva:写作似乎大有改进,“对我的主张的稻草人版本随机提出反驳”这一点也是如此。总的来说,合作起来很愉快。

strataforma:编码能力似乎与 Fable 5.1 相当,但没有使用量倍率,所以我不用再担心触及套餐上限了(耶)。你仍然需要真正去读代码并加以引导,才能得到“好”代码。写作是我目前见过的模型中最好的,而且基本不烦人

David Dabney:我真的很喜欢 5.5。我不再有像用 5 时那种神经质的紧张感/对错误细节的失调执念。感觉至少和 Fable 一样聪明;在一个复杂项目中发现了 Opus 5 漏掉的重大错误,它的行文肯定更容易理解,和它交谈也更愉快。

Will:它似乎相当不错。在一些 bake-off PR 上,它不如 Astra 那么细致(两者都是高思考模式),但它在评审方面依然一如既往地出色

在我看来,它写得比 5.5 之前的 Claude 好,但比 Astra 差

工作尚未完成,或者至少总有人会抱怨。

Avraham Eisenberg:我至少得到了两次“诚实”的引用,所以我不相信他们已经修好了英语写作。这就像一颗棕色 M&M 豆。

internetperson:写作风格仍然相当糟糕。和 opus 4.6 差不多

大模型味

当事情变得复杂时,有时你仍然需要那种大模型味。

Jeff Ketchersid:如果你想就奇怪的、分布外场景进行哲学讨论,你仍然需要 Fable。除此之外,项目管理、解释,任何事,5.5 都很棒。

Justin Kaeser:Fable 在双关语和“你妈”段子上仍然更胜一筹,我发现它忽略了技能,硬扛过了不必要的摩擦,我不得不追问它如何修复。这不是新的失败模式,但本希望这里能有更多“常识”。总体运行良好,成本高效

NondescriptTransfer:[Opus 5.5 是]比 5 快得多、更好的写手。很棒的日常主力。有几处 Fable 在大模型味上胜出。我觉得它在幽默和直觉上稍好一些。

尤其是,有报告称 Opus 5.5 在复杂情况和推断非显而易见意图方面相对吃力。

Jef Allbright:我试着用 Opus 5.5 处理一个任务,涉及撰写一些文本,内容关乎某些(三个)多重嵌套要点的含义。我很沮丧,因为无论我怎么提示它,它处理含义的深度似乎都明显不如我已经习惯的 Fable 5.1(但快得多)。

然后我把任务交给 Fable,它立刻理解了并完成了任务。

公平地说,我没有和 Opus 5 比较。

Peter Samodelkin:它很快;它更擅长对话;在解释和推断意图方面明显不如 Astra 和 Fable,但比 Sol 好。显然是我相对于 6 Sol 的日常主力,因为 Astra 消耗积分太快,而我不够有钱。

检查你的工作

Zachary Kurtz:它数学比 Fable 好,但用两者来检查工作

理论上,人应该不断让多个 LLM 检查你所有的工作,现在我们有三个(Astra、Fable 和 Opus),所以你能得到两个好的检查。实践中,我们可能不会,但我们应该。

负面反应

每当有人说“编码能力已经停滞”,我总是想到某种“技能问题”和“你不够有野心”的组合。

Yuchen Jin:今天试了 Opus 5.5。说实话没被震撼到。

- 让它研究我最近学到的一个棘手东西。它搞错了。Astra 搞对了。
- 在编码方面,Astra 仍然感觉更好。

这强化了我之前的看法:前沿 LLM 编码能力已经停滞。现在的战斗越来越关乎每美元智能。

一个人的警告,想必比 1% 罕见得多,因为我没有看到其他人这么说:

mark erdmann:了不起的模型,极好的品味,在 max 套餐上用量巨大,但 1% 的时候它会做出疯狂的事,比如搞崩 staging 服务器或 pkill 掉你 macbook 上所有正在运行的应用(即使开了自动模式)。

别急

这些天模型似乎有点过于急切。

Stition:我更信任它了,但已经有两次我说了类似“我在考虑做这个,讨论一下”,然后它就去搜索,忘了这是假设,带着假设去做了那件事。

而且,越来越难分辨差异,因为更多任务只是被处理掉了。

我认真对待你:我只用它来聊天/查东西。看起来一样。就像,除非我回家去逼它们,否则我已经分辨不出区别了。它的对话比 GPT 更有见地一些。但 GPT 仍然感觉更快、更切中要点。但 GPT 没那么懂。

有些人需要实用建议

最大的建议是校准思考层级。把最高档留到你需要的时候用。

Theo 提供了一个完整的 28 分钟视频,讲如何最大化利用 Opus 5.5 取得成功。

这是一份官方提示指南。 Anthropic 建议把整个任务交出去,说明完成的样子是什么样,然后让 Opus 自己发挥,除了在它工作时输入新命令来补充或告知任务。保留一份任务清单,阅读它需要你提供什么,让它审查代码,分享一手资料,即使它们是视觉形式的。都是些基本的东西。

他们还提醒你,你不再需要说‘努力思考’之类的话了。

最后一个问题,一如既往,是哪个模型该用在什么地方?

一如既往,针对你的用例测试这些模型,弄清楚什么适合你。

我目前的猜测大致是:

  1. Opus 5.5 是你的默认选择。除非你有充分理由不用它,否则就用它。

  2. 当你主要关心专家领域的正确性,或者你需要最大化‘出价模型嗅觉’、做分布外的事情并获得不寻常的创造力时,Fable 5.1 胜出。

  3. GPT-6 Astra 适合你想做雄心勃勃的编码和其他项目、而你不需要漂亮可读的代码时,适合网络搜索,适合某些形式的科学工作,当然也适合当你达到 Claude 订阅上限但仍有 Codex 额度时。

  4. 其他更便宜的模型,包括 Luna,适合你不需要额外火力时,或者当你的模型需要是开源的时。

  5. 如果你在做独特而酷炫、或者特别注重细节而非前沿能力的事情,那就有各种各样的选择,随你所愿。

来源:Zvi Mowshowitz · thezvi.substack.com