GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的成本、编码与路由对比
GLM-5.3 vs. Claude Fable 5 on DeepSWE: Cost, Coding, and Routing
Together AI 在 DeepSWE 的 113 个任务、每个配置 4 次试验共 904 次 rollout 上对比 GLM-5.3 与 Claude Fable 5,两者首次通过率几乎持平,Fable 5 为 69.7%,GLM-5.3 为 69.0%。
同一基准下两款模型首次通过率几乎持平,成本却差 5.4 倍,读者可据此判断默认选型与升级路由的取舍。
在我们对 GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的对比中——该基准测试跨多种任务类型和编程语言考察模型的软件工程能力——两个模型在质量上几乎难以区分。Fable 5 在 pass@1 上领先 0.7 个百分点。它每次 rollout 的成本也高出 5.4 倍,是 DeepSWE 榜单上最昂贵的单一配置。这种组合让真正有趣的问题变得很窄:当准确率相同时,这笔溢价买到了什么?
DeepSWE · 正面交锋
GLM 5.3 与 Claude Fable 5 一览
| 模型 | Pass@1 | 平均成本 | 每 $100 解出数 | 输出 token | 步数 |
|---|---|---|---|---|---|
| glm-5.3 [max] | 69.0% ± 2.7% | $3.99 | 17 | 80k | 124 |
| claude-fable-5 [max] | 69.7% ± 2.3% | $21.63 | 3 | 114k | 85 |
我们在全部 113 个 DeepSWE 任务上让 GLM-5.3(max)对阵 Claude Fable 5(max),每个任务四次试验,数据来自已发布的逐次试验记录:共 904 次 rollout,每个模型 452 次。两者都属于有纪律、低回归的流派,这正是它们表现如此相似的原因。以下所有数字均来自本次运行,因此可能与其他公开的 GLM-5.3 与 Claude Fable 5 评分卡不同。

DeepSWE 记分板:pass@1 与 pass@k
单次尝试是平局。在 DeepSWE 官方评分下,Fable 5 首次尝试解出 69.7% 的任务,GLM-5.3 解出 69.0%,差距完全在噪声范围内。一旦允许重试,两个模型就拉开了差距,而且是朝着 GLM 有利的方向。两次尝试时 GLM-5.3 以 81.1% 对 77.1% 领先。四次尝试时以 87.6% 对 84.1% 领先。
这个开放模型以极低的成本匹配了 Fable 的首次尝试准确率,而且在允许重试后还保持着更高的上限。无论尝试多少次,为 Fable 多付 5.4 倍都买不到更多覆盖。

成本对比:GLM-5.3 与 Claude Fable 5 定价
每次 rollout 3.99 美元,GLM-5.3 比 Fable 的 21.63 美元低 5.4 倍:每 100 美元解出 17 个任务,而 Fable 只有 3 个。Fable 是榜单上最昂贵的配置,而这一价格并未让 GLM 付出速度代价。GLM-5.3 平均每次 rollout 耗时 35 分钟,Fable 为 34 分钟,大致相当。
token 画像解释了这次运行的形态。GLM-5.3 是更不啰嗦的模型(输出 80k token,Fable 为 114k),尽管它步数更多(124 对 85)。Fable 每步写得更多,GLM 则采取更多且成本更低的步骤。两者都不更快,但只有一个成本只有五分之一。

覆盖与可靠性:GLM-5.3 与 Fable 5 的差异所在
将 pass@1 分解为覆盖(至少解出一次的任务)和可靠性(这些任务上的通过率),两者落在平面上的相近角落,GLM 略远一些。GLM-5.3 的覆盖更高,为 87.6%,Fable 为 84.1%。Fable 每次尝试略更稳定,可靠性为 82.0%,GLM 为 78.8%,并且四发四中的任务更多(56 对 48)。
实际上两者都表现得像有纪律的通才,GLM 用一丝每次尝试的可靠性换取了在整个基准上明显更广的覆盖。
失败模式:每个模型如何出错
这是家族相似性最明显的地方。两个模型都只在 11% 的失败中使现有测试套件回归,远低于 GPT 家族的 20%,因此两者都可以安全接受,无需严格的回归门控。
差异很小。Fable 的大失误占比更高(18% 对 GLM 的 16%),意味着当它出错时,严重错误的频率略高。GLM 以接近失误方式失败的频率略高(61% 对 57%)。总体而言,这两个模型以同样有纪律的方式失败,这正是它们结果如此相关的原因。

按任务类型看各自优势
尽管在 pass@1 上打平,领域分布图并不相同。GLM-5.3 拿下结构化的、解释器风格的工作:查询与配置(88 对 72)、语言与运行时内部机制(83 对 78)、有状态响应式(73 对 64)、并发与持久性(62 对 45),以及程序分析(64 对 56)。并发这一项 17 分的差距,正是 Fable 最弱的领域。
Fable 则以精确契约类领域回应:数据建模与序列化(88 对 79)、构建与运维(71 对 68),以及协议一致性(55 对 44),后者是 GLM 最弱的领域。GLM 赢下五个领域,Fable 赢下三个,而 Fable 在并发上 45% 的成绩是唯一让它完全出局的赛道。

按编程语言看 GLM-5.3 与 Claude Fable 5
Fable 的理由几乎完全建立在一种语言上。它的 Rust 达到 85%,GLM 为 70,15 分的差距是这场对决中单一语言的最大差距。序列化密集型工作正是这一优势的天然搭档。
GLM 则以全场最佳的 JavaScript 回应(90 对 75),在 Go(76 对 71)和 TypeScript(61 对 57)上接近持平。Fable 守住 Python(70 对 66)。除了 Rust 和序列化密集型工作,没有任何一种语言能让 Fable 5.4 倍的溢价换来有意义的准确率优势。

GLM-5.3 与 Claude Fable 5 有多相似?
对于想同时运行两者的人来说,问题在这里。GLM-5.3 与 Fable 的逐任务相关性为 0.65,是本组中所有配对里一致性最高的。两者都解决了 88 个任务。仅 GLM 解决 11 个,仅 Fable 解决 7 个,7 个两者都失败,两个方向上都没有出现四比零的分歧。
它们的并集覆盖了 113 个任务中的 106 个(93.8%),但由于它们成功和失败的任务大体相同,将两者配对带来的多样性,不如将其中任何一个与 GPT 系列模型配对。它们近乎替代品,而当两个模型互为替代时,你保留成本更低的那个。

在两者之间路由:组合策略
如果你确实要同时运行两者,顺序和经济性仍然支持把开源模型放在前端。先运行 GLM-5.3,只有当你的测试套件拒绝答案时才升级到 Fable:每任务 10.74 美元,解决率 81.1%。这比单用 Fable(69.7%)高出十一个百分点,而每任务价格只有 Fable 自身(21.63 美元)的一半。
考虑到 0.65 的相关性,诚实的建议更简单:对大多数工作而言,单用 GLM-5.3 就能捕获 Fable 几乎所有的能力,成本只有五分之一,只有在其 Rust 和序列化专长上才值得升级到 Fable。

这意味着什么
Fable 5 和 GLM-5.3 在首次尝试准确率上是统计意义上的平手,而持平也就到此为止。GLM-5.3 成本低 5.4 倍,在 pass@2、pass@4 和覆盖率上更高,更简洁,在回归上同样自律,并且赢下八个领域中的五个,外加全场最佳的 JavaScript。
Fable 是本次测量中最昂贵的模型,而对阵 GLM 时,它只赢下三个领域,外加真正的 Rust 和序列化优势。由于两者在 0.65 相关性下近乎替代品,同时运行两者几乎没有组合收益。实际立场是:以 GLM-5.3 为默认,Fable 作为针对 Rust 密集型或序列化关键任务的狭窄而昂贵的升级选项。查看新的 GLM 5.3 Flash API。
DeepSWE · 完整结果
GLM 5.3 与 Claude Fable 5,逐项指标对比
| 指标 | GLM 5.3 [max] | Fable 5 [max] |
|---|---|---|
| pass@1(官方评分) | 69.0% | 69.7% |
| pass@1(错误计为失败) | 68.8% | 67.3% |
| pass@2 / pass@4 | 81.1 / 87.6% | 77.1 / 84.1% |
| 覆盖率 / 可靠性 | 87.6 / 78.8% | 84.1 / 82.0% |
| Solid (4/4) / walls (0/4) | 48 / 14 | 56 / 18 |
| 每次 rollout 成本 / 总计 | $3.99 / $1,806 | $21.63 / $9,346 |
| 每 100 美元解决数 | 17 | 3 |
| 平均分钟数 / 步数 | 35 / 124 | 34 / 85 |
| 平均峰值上下文 / 输出 token 数 | 155k / 80k | 205k / 114k |
| 失败剖析(接近 / 大幅失误 / 回退) | 61% / 16% / 11% | 57% / 18% / 11% |
| 获胜领域(共 8 个) | 5 | 3 |
| 获胜语言 | 2(JavaScript、TypeScript) | 3(Rust 大胜、Python、Go) |
| 逐任务相关性 / 并集 | 0.65 / 113 中的 106(93.8%) | |
| 级联 GLM → Fable(准确率 / 成本) | 81.1% / $10.74(对比仅用 Fable 的 69.7% / $21.63) | |
| Oracle 单次路由 | 78.5% | |
| 基础设施错误 | 1 | 16 |
113 个 DeepSWE 任务 · 每种配置 4 次试验 · 均以最大努力运行 · 共 904 次 rollout
常见问题
GLM-5.3 比 Claude Fable 5 更好吗?
在 DeepSWE 上,两者首次尝试的成绩在统计上持平:Fable 5 的 pass@1 为 69.7%,GLM-5.3 为 69.0%。此后 GLM-5.3 在各项指标上均胜出,包括 pass@2(81.1% 对 77.1%)、pass@4(87.6% 对 84.1%)以及覆盖率,且每次 rollout 的成本低 5.4 倍。Fable 四战全胜的任务更多(56 对 48),因此在任何单次尝试上都略为稳定。
GLM-5.3 比 Claude Fable 5 便宜多少?
在我们的运行中,以最大努力运行时,GLM-5.3 每次 rollout 成本为 \$3.99,而 Claude Fable 5 为 \$21.63,相差 5.4 倍。按每个已解决任务衡量,GLM-5.3 每 \$100 可解决 17 个任务,而 Fable 为 3 个。
用于编程,GLM-5.3 和 Claude Fable 5 哪个更好?
这取决于语言和任务类型。GLM-5.3 在 JavaScript(90 对 75)、Go(76 对 71)和 TypeScript(61 对 57)上胜出,并在八个任务领域中的五个获胜,包括并发和持久性,以 62 对 45 领先。Claude Fable 5 在 Rust(85 对 70)、Python(70 对 66)以及精确契约领域领先,其中数据建模和序列化以 88 对 79 领先。
我应该在 GLM-5.3 和 Claude Fable 5 之间进行路由吗?
仅建议选择性使用。这两个模型在我们测量过的所有配对中具有最高的逐任务相关性(0.65),因此它们在很大程度上会在相同的任务上成功和失败,其并集覆盖了 113 个任务中的 106 个。GLM 优先的级联确实能以每任务 \$10.74 达到 81.1%,远超仅用 Fable,但对大多数团队而言,更大的收益是直接默认使用 GLM-5.3,并将 Fable 保留给 Rust 密集型或序列化关键型工作。
GLM-5.3 是开放权重吗?
是的。GLM-5.3 是一个开放权重模型,因此可以自托管,或通过 Together AI 等推理提供商提供服务。Claude Fable 5 是一个闭源模型,只能通过 Anthropic 及其合作伙伴使用。
DeepSWE 上的 pass@k 是什么?
pass@k 衡量的是对某个任务的 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励第一次就做对,更高的 k 则奖励能够在多次尝试后最终找到解决方案的模型。GLM-5.3 的优势随着 k 增大而扩大。
方法与注意事项
- 数据:DeepSWE v1.1 导出,113 个任务 × 每种配置 4 次试验,均以最大努力运行,来自已发布的逐次试验记录。每方 452 次试验。
- 评分:头条通过率使用 DeepSWE 的官方评分(included_in_score,排除基础设施错误)。Fable 因模型路由产生了 16 个基础设施错误,因此其严格将错误计为失败的分数为 67.3,而官方为 69.7。GLM-5.3 有 1 个。
- pass@2、pass@4、覆盖率、并集和相关性使用逐任务通过次数。
- 成本为已发布的逐次试验 cost_usd。Fable 的与轨迹 total_cost_usd 完全一致,而 GLM 的仅为索引值。分析时,GLM-5.3 批次的逐轮轨迹 JSON 不在公共 CDN 上。
- 失败剖析使用已发布的逐测试分数。接近通过意味着在基线保持不变的情况下,至少 80% 的新测试通过。回归意味着某个基线测试被破坏。领域使用基于产物的任务分类法。
- 级联假设验证器根据任务决定升级和独立性。预期准确率在顺序上是对称的,但成本不是,因此先使用成本较低的模型。鉴于 0.65 的相关性,组合收益有限。预言机路由器是逐任务的最佳单次选择,是任何单次路由器的上界。
来源:Together AI Blog · together.ai