跳到正文
Tessl Blog· Nicolas Fortuin·· 2026-06-12精选AI 评分67

Claude Fable 5 与 Opus 4.8 实测对比:Mythos 宣传与真实表现

Claude Fable 5 vs Opus 4.8: The Mythos Hype Meets Reality

AI 导读

Tessl 用近 1000 个共享场景对 Claude Fable 5 与 Opus 4.8 做了双次评分,在 917 个共同完成的任务上 Fable 5 总体得分 92.9、Opus 4.8 为 92.0,差距不到 1 分。

推荐理由

基于近千个共享场景的双模型实测,量化了技能上下文与模型升级各自带来的收益差距。

正文 · AI 翻译

几个月来,Anthropic 最有趣的模型是一个我们无法使用的模型。Mythos 是该公司声称能力过强而无法发布的内部系统,它发现软件漏洞的水平触发了自身的安全阈值。2026 年 6 月 9 日,这一层级首次公开亮相,名为 Claude Fable 5。作为生产编码智能体支柱的 Opus 4.8,突然有了一个能力整整高出一个层级的继任者。

这对任何运行编码智能体的人来说都引出了两个问题。实际的问题是,你是否应该把你的智能体集群从 Opus 4.8 迁移到 Fable 5。更大的问题是,Mythos 级模型——Anthropic 因能力过强而扣下不发的那一档——是否配得上这个名字所承诺的东西。本文回答这两个问题,而数字讲述的故事比公告本身更有趣。

我们让两个模型跑同一套评估,接近 1000 个共享场景,每个场景评分两次,一次不提供技能,一次在上下文中提供相关技能。简短的回答是,截至 2026 年中期,对于大多数智能体集群来说,Opus 4.8 仍然是更好的选择,而 Mythos 炒作与实测现实之间的差距才是数据中真正值得关注的故事。

Mythos 级模型是 Claude 中能力高于 Opus 级的一档。它达到了 Anthropic 认为高风险的阈值,尤其是在发现和利用软件漏洞方面。Fable 5 和 Mythos 5 是同一个底层模型,能力相同。区别在于安全防护措施:Fable 5 是公开版本,附带安全分类器;而 Mythos 5 仅限获批合作伙伴使用,运行时没有这些分类器。

业界对 Mythos 级模型的期待

发布之前,各种猜测毫不含蓄。在 Reddit、X 以及一系列科普文章中,Mythos 被描绘成将改变智能体工作方式的模型,而不仅仅是回答得更好。反复出现的预测集中在四种能力上:

  • 在一次连贯的操作中重构大型代码库。
  • 发现经验丰富的工程师遗漏的安全缺陷。
  • 在单个难题上无人监督地工作数小时。
  • 表现得像协作者,而不是你逐轮操控的助手。

在这四点中,网络安全方面的说法有硬证据支撑。通过 Project Glasswing,约 50 个拥有 Mythos Preview 访问权限的早期合作伙伴报告发现了超过 10,000 个高危或严重级别的漏洞,该项目此后已扩展到 150 多个组织。Anthropic 的首席产品官 Mike Krieger 称其为“我们构建过的最强大的一类系统”。这就是这个名字所兜售的梦想:一个强大到只能留在实验室里的模型。

真正到达公众手中的版本更窄,而且是刻意为之。你实际能使用的模型是 Fable 5,即包裹在安全分类器中的 Mythos 级系统。它是否兑现了承诺,取决于那个承诺与已发布版本之间的差距。

核心数字:Claude Fable 5 对比 Opus 4.8

评估中的每个场景都是与已发布技能绑定的真实智能体任务,从两个维度评分:指令遵循(智能体是否按照被告知的方式去做被告知的事)和任务完成(是否达成目标)。总分将指令遵循权重设为 4,任务完成权重设为 3,然后除以 7。每个任务都在有技能和无技能两种情况下运行,因此技能带来的提升可以直接看到。任务和技能都是公开的,在 task-evals-for-skills 数据集中,你可以自行查看任何场景。

这个设计是有意为之的。任务来自已发布的技能,因此它们反映的是真实团队编写技能所针对的工作,而不是用来探测模型上限的前沿难题。这就是为什么两个模型的任务完成率都很高,以及为什么区分它们的信号是指令遵循:按照技能要求的具体方式完成工作。

维度(含技能)Fable 5Opus 4.8
总体得分92.992.0
总体得分(无技能,基线)75.774.5
技能带来的总体提升+17.2+17.5
指令遵循89.388.0
任务完成97.897.4
完成所需轮次16.916.2
每任务输出 token 数9,02510,687
标价(输入 / 输出,每百万 token)$10 / $50$5 / $25
每任务成本(平均)$1.25$0.74
每美元得分74125

在两个模型都运行的 917 个场景上,Fable 5 以 0.9 分领先总体得分(92.9 对 92.0)。逐场景来看,在两点阈值下,两者在 61% 的任务上打平,Fable 胜出 24%,Opus 胜出 16%。比 Opus 高出一个能力层级,而在日常智能体技能任务上,质量差异在噪声范围内。

这个数字之下有一个前提。这 917 个是两者都完成并评分的任务。Fable 5 拒绝了 26 个 Opus 4.8 完成的任务,我们将它们排除在外,因此这种近乎打平只在 Fable 同意执行的任务上衡量。这一排除结果恰恰是这次比较中最能说明问题的部分,我们将在下文回到这一点。

为什么智能体技能评估比模型升级更重要

这个数字重新定义了这次比较。技能为两个模型都带来约 17 分的总体提升:Fable 5 为 +17.2,Opus 4.8 为 +17.5。从 Opus 4.8 升级到 Fable 5 在共享任务上带来的提升不到 1 分。你提供的上下文对智能体的影响远大于你选择的前沿层级。

提升集中在指令遵循上,两个模型都从技能中获得超过 27 分的提升,而任务完成提升不到 5 分。两个模型通常都能自行达成目标。没有技能时它们无法可靠做到的,是遵循真实任务所要求的具体约定、约束和步骤。这正是优秀技能所编码的内容。

技能接受度是指当你提供相关技能时,智能体输出改善的程度。它主要体现在更好的指令遵循上。它之所以重要,是因为它可以超过模型选择的影响,这就是在追逐最新层级之前投资于智能体技能的实际理由。在有和没有技能的情况下运行同一任务,然后衡量差异,这就是任务评估。这也是了解模型升级是否在你的工作负载上物有所值的唯一方法,而这正是智能体技能评估的用途。

价格差距是大多数团队的决定性因素

在我们衡量的智能体技能任务上,这种取舍归结为为边际收益支付高昂溢价。Fable 5 标价为每百万输入 token 10 美元、每百万输出 token 50 美元,而 Opus 4.8 为 5 美元和 25 美元,在每个 token 类别上都恰好是两倍,包括缓存读取和写入。作为回报,在我们 917 个共享场景中,你得到 92.9 对 92.0 的总体得分,0.9 分的优势完全落在两者可互换的范围内。这是日常智能体工作的情况,而不是对我们评估未测试的招牌 Mythos 能力的裁决。

Token 行为压低了单价,但并未消除差距。在 917 个共享场景中,Fable 5 每个任务生成的输出 token 约少 16%(9,025 对 10,687),因此每个任务的真实成本为 1.25 美元对 0.74 美元,溢价 73%,而非干净的 2 倍。价值差距才是要记住的数字:Opus 4.8 每美元回报 125 分,而 Fable 5 为 74 分,即每花一美元多出约 69% 的质量。

对单次会话而言,差异只是几分钱。但对于每天运行数千个 agent 任务的集群来说,这是财务团队会追问的明细项,而在大多数团队实际运行的任务上,质量提升不到一个点却要付两倍价格,这并不容易向他们交代。

Fable 拒绝 Opus 能顺利完成的工作

Fable 5 与 Opus 4.8 之间最重大的差异并不在记分牌上,而在于定义 Mythos 级别的安全层。

Fable 5 出厂时带有覆盖四个领域的防护措施:网络安全、生物与化学、蒸馏,以及前沿 LLM 开发。对于前三个领域,触发的请求会以拒绝形式返回。Anthropic 的设计会将其转交给 Opus 4.8 并通知用户,但该回退是可选而非默认,因此在像我们这样的默认配置中,被阻止的请求只是直接拒绝。

第四个领域在本次运行中表现不同。根据 Anthropic 自己的文档,涉及前沿 AI 开发的请求不会被拒绝,甚至不会被标记。模型会悄悄引导或微调其回答,而不通知用户。这种静默操纵引发了最尖锐的反弹,6 月 11 日,即本次运行后的第二天,Anthropic 将其改为像其他三个领域一样的可见分类器,同时承认这些限制“过于保守”。由于它从未产生拒绝,该领域在我们的数据中未留下痕迹;任何影响只会以悄悄变弱的回答形式出现。

Mythos 级模型会按设计将某些请求路由到较弱的模型,因此你的测试框架需要检测这种回退,而不是相信每个响应都来自 Fable。而受影响的领域恰恰是你最想亲自检查的领域,这正是 上下文治理与安全 的实用边界:在评估中捕获回归,而不是在生产中。

我们的运行展示了这一点如何体现,结果并不好看。Fable 5 在其尝试的约 940 个任务中拒绝了 26 个,返回带有拒绝停止原因的使用政策阻止,而不是执行工作,而 Opus 4.8 完成了所有这些任务并全部得分。Fable 拒绝的内容才是揭示性的部分。其中四个是防御性安全审查,包括“在部署前审查此 Flask 应用程序的安全漏洞”,被以“违规网络内容”为由阻止。五个是常规生物信息学任务,例如对单细胞 RNA-seq 文件运行质量控制。一个是关于 AI 辅助药物发现格局的文献综述。Anthropic 以发现关键软件漏洞为卖点的一类模型,却拒绝为拥有该应用的开发者审计一个 Flask 应用。Anthropic 自己“过于保守”的承认在这里最为刺耳。

在 Fable 确实完成的安全任务上,它是有竞争力的。在来自 Auth0、Better Auth 和 Bitwarden 的 51 个身份验证与安全技能场景中,Fable 5 搭配该技能平均得分 95.0,而 Opus 4.8 为 96.6,几乎打平。教训并不是某个模型安全、另一个不安全,而是 Mythos 级模型有时会拒绝你最为需要的防御性工作,只有在你自己的任务上做评测才能告诉你问题出在哪里。

Fable 兑现了 Mythos 的承诺吗?

我们的评测回答了部署决策真正关心的问题:两个模型如何在数十个工具生态系统中处理数百个真实的、由技能驱动的智能体任务,而这正是大多数团队实际运行编码智能体时所做的工作。Mythos 那些标志性的壮举不在本次评测范围内,但它所捕捉到的日常行为,恰恰是你把一队智能体指向某个模型时真正买到的东西。

数据确实显示了 Fable 的额外能力在正常使用中体现在哪里。按拥有该技能的组织分组,Fable 5 在网络研究和抓取类工作负载上领先:Apify(总体 +7.8)、Google Gemini(+4.6)、Tavily(+3.4)和 Firecrawl(+2.7)。如果你的智能体需要从开放网络上抓取、映射和提取数据,Fable 5 是更强的选择。Opus 4.8 则在 Fable 退步的地方守住了阵地:Mastra(-7.3)、Auth0(-4.5)和 Axiom(-2.5)。

所以,自主协作者这一 Mythos 之梦并不是大多数团队第一天就会买的东西。他们会买的是一个在指令遵循上略好、在网络研究上明显更好、价格翻倍,而且被分类器把关、偶尔还是会把活儿交给 Opus 4.8 的模型。

何时使用哪一个

如果你大规模运行编码智能体集群并关心每任务成本,选择 Opus 4.8。对大多数工作负载而言,质量差异在噪声范围内,Opus 每美元能换来多得多的分数,而且它没有需要围绕其设计的回退层。

如果你的智能体要做大量网络研究和抓取,如果你需要在长周期任务上使用它的推理深度,或者你有一个确实能从 Opus 之上的能力级别中受益的工作负载,那就选择 Fable 5。为大约 73% 的每任务溢价做好预算,并从第一天起就在你的测试框架中构建回退检测。如果你的工作涉及分类器领域,在依赖它之前,先确认模型没有悄悄路由到 Opus 4.8。

Fable 的优势在你围绕它构建时才会显现,而不是在你原封不动地把它换进 Opus 4.8 流水线时。Fable 是更自主的模型,但这种优势只有在为它构建的流程中才能兑现:更长时间的无监督运行、更大的工作单元、更少的逐步引导。

对几乎所有人来说,更大的杠杆既不是这个模型也不是那个模型。技能带来约 17 分;模型升级带来不到 1 分。在你的 tessl.json 中标准化模型,在向集群推广之前用评测证明这次切换,并留意那些 Mythos 级模型悄悄拒绝执行的任务。

想看看技能如何改变你自己智能体的行为——在你自己的任务上、跨两个模型?从 Tessl Registry 开始,在切换之前先运行评测。

来源:Tessl Blog · tessl.io