GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 上的成本、编码与路由对比
GLM-5.3 vs. GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次、共 904 次 rollout,对比 GLM-5.3(max)与 GPT-5.6 Sol(max):Sol 单次 pass@1 为 72.7%,GLM-5.3 为 69.0%,但 GLM-5.3 在 pass@2 追平(81.1% 对 81.0%)、pass@4 反超(87.6% 对 85.8%)。
同一批 113 个 DeepSWE 任务上对比两款模型的首答、重试与成本,并给出可照搬的路由与级联方案。
我们在全部 113 个 DeepSWE 任务上,用 GLM-5.3 (max)对阵 GPT-5.6 Sol(max),每个任务四次试验,数据来自已发布的逐次试验记录:共 904 次 rollout,双方各 452 次。Sol 是精度旗舰。GLM-5.3 是缩小了差距的开源权重挑战者。以下每个数字都来自这次运行,因此可能与其他公开的 GLM-5.3 对 GPT-5.6 Sol 评分卡不同。
DeepSWE · 正面对决
GLM 5.3 与 GPT 5.6 Sol 一览
| 模型 | Pass@1 | 平均成本 | 每 $100 解出数 | 输出 token | 步数 |
|---|---|---|---|---|---|
| glm-5.3 [max] | 69.0% ± 2.7% | $3.99 | 17 | 80k | 124 |
| gpt-5.6-sol [max] | 72.7% ± 2.2% | $8.37 | 9 | 60k | 61 |
在 DeepSWE 上,GPT-5.6 Sol 仍保持着单次尝试的桂冠。该基准测试模型在多种任务类型和编程语言中的软件工程能力。GLM-5.3 以一半的价格落后不到四分,而一旦允许多次尝试,它就反超了。这是开源层级距离前沿最近的一次,而值得回答的问题是 Sol 剩余的溢价究竟买到了什么。

DeepSWE 记分板:pass@1 与 pass@k
单次尝试,Sol 略胜一筹:在 DeepSWE 官方评分下,pass@1 为 72.7%,GLM-5.3 为 69.0%。允许重试后,排名就翻转了。两次尝试时,GLM-5.3(81.1%)已经追平 Sol(81.0%);四次尝试时,GLM-5.3 的 pass@4 为 87.6%,领先 85.8%。开源模型覆盖更广,因此在任何 best-of-k 场景中它都是更准确的选择,而且它额外尝试的成本只有 Sol 的一半。

成本对比:GLM-5.3 与 GPT-5.6 Sol 定价
每次 rollout 3.99 美元,GLM-5.3 比 Sol(8.37 美元)便宜 2.1 倍,按价值计算就是每 100 美元解出 17 个,而 Sol 为 9 个。Sol 用延迟换回了这部分溢价:平均 19 分钟、61 步,而 GLM 为 35 分钟、124 步,输出 token 为 60k,GLM 为 80k。这种取舍异常清晰。Sol 是更快、更简洁的工人;GLM-5.3 是成本更低、走长路的那一个。如果有人在等,Sol 仅凭延迟就值回溢价。如果等的是预算或批处理队列,GLM-5.3 更值得买。

覆盖率与可靠性:精度与广度
把 pass@1 和 pass@4 分解为覆盖率(四次尝试中至少解出一次的任务)和可靠性(四次全部解出的任务),分界就很清晰。Sol 是精度那一角:可靠性 84.5%,有 61 个任务四次全解,这是一个碰什么就能拿下什么的模型的标志。GLM-5.3 换到了另一个轴:覆盖率更广,为 87.6% 对 85.8%,但可靠性更低,为 78.8%,稳固任务也更少,48 对 61。这一覆盖率优势与它的 pass@4 领先是同一件事。GLM-5.3 触及的基准范围比 Sol 更多,但每次触及的转化率略低。
失败模式:两个模型各自如何出错
两者的失败画像差异很大,而这种分化有利于开源模型。Sol 在 20% 的失败中破坏了仓库现有的测试套件,这是 GPT 家族的回归特征。GLM-5.3 这样做的比例为 11%;当它失手时,通常是向前失手,即基线完好下的接近成功,接近成功率为 61%,而 Sol 为 54%。因此,成本更低的模型也是更安全、无需沉重回归门禁即可接受的模型。在采纳 Sol 的 diff 之前,要围绕它跑一次完整回归。GLM-5.3 则不太需要这道护栏。

按任务类型看各自胜在何处
领域划分得很均匀,各占四项。Sol 负责数据建模与序列化(92%)、构建与运维工具(73%)、并发与持久性(72%)以及协议一致性(59%),这些正是精确契约、系统密集型的工作。GLM-5.3 负责查询与配置语言(88%,是榜单上单项最高分)、语言与运行时内部机制(83%)、有状态响应式(73%)以及程序分析,在体量上以 64 比 64 打平。这是结构化的、解释器风格的工作。GLM-5.3 唯一明显的短板是协议一致性,为 44%,落后 Sol 15 个百分点。Sol 没有单一弱项;它只是全面都很强。此处的任务类型由 LLM 根据每个基准提示词分类得出。

按编程语言比较 GLM-5.3 与 GPT-5.6 Sol
GLM-5.3 的突出项是 JavaScript,达到 90%,领先 Sol 的 75% 达 15 个百分点,是榜单上所有模型中最好的 JS 成绩。它还拿下了 Rust,70 对 60。Sol 则以 Python(74 对 66)、Go(79 对 76)和 TypeScript(66 对 61)回应。路由规则很简单:JavaScript 和 Rust 交给 GLM-5.3,其余交给 Sol,而 GLM-5.3 在几乎所有地方都是成本更低、差距很小的第二名。

GLM-5.3 与 GPT-5.6 Sol 有多大不同?
差异大到足以据此路由。逐任务相关性为 0.43,对于两个总体成绩如此接近的模型来说,这是真实的分歧。它们都解决了 90 个任务;GLM-5.3 单独解决 9 个,Sol 单独解决 7 个,另有 7 个两者都失败。它们的并集覆盖了 113 个任务中的 106 个(93.8%),而艰难的分歧是单向的:GLM-5.3 以四比零横扫两个 Sol 从未攻克的任务(koota-pair-relation-tracking、participle-grammar-conflict-analysis),而 Sol 没有横扫任何 GLM-5.3 得零分的任务。这个开放模型到达了旗舰模型到不了的地方。

在两者之间路由:组合策略
这种分歧加上价格,使级联成为榜单上最好的一行。先运行 GLM-5.3,只有当你的测试套件拒绝答案时才升级到 Sol:以每任务 \$6.61 的成本解决 85.9%。这比单独使用 Sol(72.7%)高出十三个百分点,而且仍然比一次 Sol 运行(\$8.37)更便宜,因为开放模型以 Sol 一半的价格清掉了大部分队列,而剩下的难题获得了第二次独立尝试。级联也胜过完美的一次性预言机路由器(83.8%),因为两次独立尝试胜过一次完美选择。无论哪个模型打头,预期准确率都相同,但 GLM 优先更便宜(\$6.61 对 \$9.47),所以让成本更低的模型打头。

这意味着什么
GPT-5.6 Sol 保住了单次尝试的王冠以及随之而来的一切:最高的首次尝试成功率、最高的可靠性,以及迄今为止最快、最简洁的运行。你为此付出大约两倍的价钱,而且必须防范其 20% 的回归率。GLM-5.3 是性价比之选和 best-of-k 之选:首次尝试差距在四个百分点以内,在 pass@2、pass@4 和覆盖率上领先,价格只有一半,失败情况更干净,并且拥有榜单上最好的 JavaScript。它相对 Sol 的真正弱项是协议一致性和原始速度。而且由于两者确实存在分歧,最犀利的部署方式不是单独使用任何一个。而是以 GLM-5.3 作为成本更低的前端,以 Sol 作为由验证器把关的升级选项,从而以低于旗舰自身每任务价格的成本,获得超越旗舰的覆盖率。查看新的 GLM 5.3 Flash API。
DeepSWE · 完整结果
GLM 5.3 与 GPT 5.6 Sol,逐项指标对比
| 指标 | GLM 5.3 [max] | GPT 5.6 Sol [max] |
|---|---|---|
| pass@1(官方评分) | 69.0% | 72.7% |
| pass@1(错误计为失败) | 68.8% | 72.3% |
| pass@2 / pass@4 | 81.1 / 87.6% | 81.0 / 85.8% |
| 覆盖率 / 可靠性 | 87.6 / 78.8% | 85.8 / 84.5% |
| Solid (4/4) / walls (0/4) | 48 / 14 | 61 / 16 |
| 每次 rollout 成本 / 总计 | $3.99 / $1,806 | $8.37 / $3,783 |
| 每 $100 解决的题数 | 17 | 9 |
| 平均分钟数 / 步数 | 35 / 124 | 19 / 61 |
| 平均峰值上下文 / 输出 token 数 | 155k / 80k | 187k / 60k |
| 失败剖析(接近通过 / 回归) | 61% / 11% | 54% / 20% |
| 获胜领域(共 8 个) | 4 | 4 |
| 获胜语言 | 2(JavaScript、Rust) | 3(Python、Go、TypeScript) |
| 逐任务相关性 / 并集 | 0.43 / 113 中的 106(93.8%) | |
| 级联 GLM → Sol(准确率 / 成本) | 85.9% / $6.61(对比仅用 Sol 的 72.7% / $8.37) | |
| Oracle 单次路由 | 83.8% | |
| 基础设施错误 | 1 | 2 |
113 个 DeepSWE 任务 · 每种配置 4 次试验 · 两者均为最大努力 · 共 904 次 rollout
常见问题
GLM-5.3 比 GPT-5.6 Sol 更好吗?
这取决于指标。GPT-5.6 Sol 在 DeepSWE 上赢得单次尝试质量(pass@1 为 72.7%,对比 69.0%),四局全胜的任务更多(61 对 48),且每次 rollout 大约快一倍。GLM-5.3 在 pass@2 上持平,并在 pass@4 上获胜(87.6% 对 85.8%),每次 rollout 成本只有一半,因此对于高吞吐量或可容忍重试的智能体工作而言,它是更具性价比的选择。
GLM-5.3 比 GPT-5.6 Sol 便宜多少?
在我们的运行中,最大努力下 GLM-5.3 每次 rollout 成本为 \$3.99,而 GPT-5.6 Sol 为 \$8.37,约低 2.1 倍。按每个已解决任务衡量,GLM-5.3 每 \$100 可解决 17 个任务,而 Sol 为 9 个,每美元解决的活大约是其两倍。
用于编程时,GLM-5.3 和 GPT-5.6 Sol 哪个更好?
两者各占半壁江山。GLM-5.3 拿下 JavaScript(90 对 75)和 Rust(70 对 60);Sol 拿下 Python(74 对 66)、Go(79 对 76)和 TypeScript(66 对 61)。按任务领域划分,双方各赢四项:Sol 领先精确契约和系统类工作,GLM-5.3 领先查询与配置语言、运行时内部机制和有状态响应式。
我应该在 GLM-5.3 和 GPT-5.6 Sol 之间做路由吗?
可以,前提是你能验证结果。两者差异明显(相关性 0.43),且失败方式不同,因此先运行 GLM-5.3,当测试套件拒绝其输出时再升级到 Sol,可达到 85.9%、每任务 \$6.61,优于仅用 Sol(72.7%、\$8.37)以及完美的单次 oracle 路由(83.8%)。两者合计覆盖 113 个任务中的 106 个。
DeepSWE 上的 pass@k 是什么?
pass@k 衡量的是对某个任务的 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励第一次就做对;更高的 k 则奖励能在多次尝试后最终找到解决方案的模型。随着 k 增大,GLM-5.3 的优势也随之扩大。
方法与注意事项
- 数据:DeepSWE v1.1 导出,113 个任务,每种配置 4 次试验,两者均为最大努力,来自已发布的逐次试验记录。每方 452 次试验。
- 评分:头条通过率使用 DeepSWE 的官方评分(included_in_score,排除基础设施错误)。GLM-5.3 有 1 个基础设施错误,Sol 有 2 个,因此官方评分与严格评分几乎一致。pass@2、pass@4、覆盖率、并集和相关性使用逐任务通过次数。
- 成本为索引中已发布的逐次试验 cost_usd。分析时,GLM-5.3 批次的逐轮轨迹 JSON 不在公共 CDN 上,因此本分析为索引级别。
- 失败剖析使用已发布的逐测试比例。接近通过指至少 80% 的新测试通过且基线保持完好;回归指某个基线测试被破坏。领域使用基于产物的任务分类法。
- 级联假设有一个验证器根据任务决定是否升级,并假设任务独立。期望准确率与顺序对称,成本则不然,因此应以成本较低的模型打头阵。oracle 路由是逐任务的最佳单次选择,是任何单次路由的上界。
来源:Together AI Blog · together.ai