开源编码智能体对比 Sonnet 4.6:GLM 5.2、MiniMax M3、Kimi 2.7 与 Qwen 3.7 实测
Open-Source Agents vs Sonnet 4.6: GLM 5.2, MiniMax M3, Kimi 2.7 and Qwen 3.7 Tested
Tessl 用近 1000 个真实编码场景、每个场景跑两次(无辅助与附带 agent skill),对比 GLM 5.2、MiniMax M3、Kimi K2.7-code、Qwen3.7-Plus 与 Claude Sonnet 4.6。
近千个真实编码场景的对照评测,给出开源模型与 Sonnet 4.6 在质量、成本与指令遵循上的具体差距。
一年前,在开源编码模型和大型实验室的前沿模型之间做选择,其实算不上什么选择。你用前沿模型,然后为它付费。开源模型更便宜,而你能感觉到便宜的原因。
这一差距已经缩小。我们用四个开源模型——GLM 5.2、MiniMax M3、Kimi K2.7-code 和 Qwen3.7-Plus——与 Claude Sonnet 4.6 进行了同一套评估:近 1,000 个真实编码场景,每个场景解决两次,一次无辅助,一次由 agent skill 提供该任务的约定。结果并不是一个昂贵模型获胜的简单故事。一个开源模型在质量和成本上同时击败了 Sonnet。另一个是测试中最便宜的,便宜一个数量级,却仍然无法被信任去遵循一条清晰的指令。实际的问题是:如果你今天要选择一个编码 agent,开源距离前沿有多近,它又在哪里仍然会崩溃?
设置:相同的任务,有和没有 skill
每个模型都两次解决相同的场景。基线运行只给模型任务,别无其他。skill 运行给模型相同的任务,外加一个 agent skill,即针对相关工具打包好的约定和指令。比较两次运行可以隔离出一件事:当你把正确的上下文交给模型时,它能提升多少。
我们从两个维度对每次运行评分。指令遵循衡量模型是否按照要求的方式完成任务,使用正确的 API、约定和约束。任务完成衡量工作是否能运行并产生预期结果。总分对两者按四比三加权,偏向指令遵循,因为一个自信地完成错误任务的编码 agent 比一个卡住的 agent 更糟。所使用的任务和 skill 是公开可用的,在 task-evals-for-skills 数据集中,因此你可以自行检查任何场景。
成本是每个任务的平均美元数,根据每个场景测得的 token 数量按真实标价重新计算。四个开源模型在 Fireworks 上按其公布的 Standard 费率运行。Sonnet 4.6 按 Anthropic 的标价计算。我们报告仅解决成本,不包括评分步骤,与本系列其余部分采用相同的惯例。
需要记住的一个数字:在所有模型中,skill 为总分增加了约 20 分,而几乎所有这些增益都在指令遵循上。这些模型本来就能完成大多数任务。它们缺少的是约定,而这正是 skill 所承载的。
五个编码 agent 在准确率上的得分
以下是每个模型在其配对场景上的完整记分板,先是基线,然后是带 skill。
| GLM 5.2 | MiniMax M3 | Sonnet 4.6 | Kimi K2.7-code | Qwen3.7-Plus | |
|---|---|---|---|---|---|
| 总分 | 91.9 | 91.4 | 90.8 | 88.7 | 82.2 |
| 总分(基线,无 skill) | 71.7 | 70.5 | 66.4 | 69.2 | 62.7 |
| skill 带来的总提升 | +20.2 | +20.9 | +24.4 | +19.5 | +19.5 |
| 指令遵循 | 87.4 | 87.2 | 86.1 | 82.5 | 77.2 |
| 指令遵循(基线) | 56.2 | 55.4 | 49.1 | 52.8 | 45.7 |
| 任务完成 | 97.8 | 97.0 | 97.1 | 96.9 | 88.9 |
| 完成所需轮次 | 18.5 | 22.7 | 17.7 | 27.5 | 16.5 |
| 每个任务的输出 token 数 | 8,813 | 8,952 | 6,841 | 21,787 | 12,296 |
| 标价(输入 / 输出,每 MTok) | $1.40 / $4.40 | $0.30 / $1.20 | $3 / $15 | $0.95 / $4.00 | $0.40 / $1.60 |
| 每个任务的成本 | $0.289 | $0.207 | $0.296 | $0.661 | $0.068 |
| 每美元得分 | 318 | 442 | 307 | 134 | 1,204 |
在任何分析之前,有两个事实就跳了出来。表格顶部在质量上几乎打平:第一名到第四名只差四分。而成本列跨越了十倍。换句话说,决策不再关乎谁能做这项工作。它关乎你愿意为最后一点准确率付多少钱,以及你实际上能信任哪个模型去遵循指令。
把五个模型按成本和按质量排成一排,其中三个对得起它们的价格:Qwen 在便宜的一端,MiniMax 在中间,GLM 5.2 在顶端。测试中没有任何模型能同时在成本和质量上击败这三者。Sonnet 4.6 不在其中。GLM 5.2 得分一样高,每个任务的成本还略低,所以在这项测试中,没有理由放着它去选 Sonnet。Kimi 是测试中最贵的模型,准确率却只排第四。
与 Sonnet 打平的模型
本系列标题承诺了一个能与 Sonnet 打平的开源模型。数据比这更强。GLM 5.2 的总体得分为 91.9,而 Sonnet 为 90.8,且每个任务成本为 $0.289,而 Sonnet 为 $0.296。在直接比较五个模型都运行过的场景时,GLM 5.2 达到 93.5,Sonnet 为 91.9。这个开源模型在质量和成本上都领先。
有一个细微之处值得精确说明,因为它指向相反的方向,而且比较应当公平。在这些任务中,Sonnet 在 54% 的任务上是单个最佳模型,超过任何其他模型。所以 Sonnet 以微弱优势赢下典型场景。GLM 5.2 在平均值上仍然领先,因为它更稳定:拖低其均值的灾难性低分更少。如果你在意中位数任务,Sonnet 略胜一筹。如果你在意避免糟糕的一天,GLM 5.2 胜出。两种解读都成立,而且都指向顶端真正的平局,而非一边倒。
MiniMax M3 在质量上与 Sonnet 几乎处于同一位置,91.4 对 90.8,而每个任务成本低约 30%。它是榜首的性价比之选。
不听话的模型
Qwen3.7-Plus 是那个警示故事,而有趣之处在于它失败的方式。它并不是一个处处得分都更低的较弱模型。它是一个会干活、但在干活时无视你指令的模型。
从最明显的信号说起。Qwen 在测试中指令遵循得分最低,使用该技能时为 77.2,而其他所有模型都在 82 或更高,基线也最低,为 45.7。但平均值低估了问题,因为 Qwen 的得分波动很大。即便手握该技能,它仍有 16% 的场景在指令遵循上得分低于 50,而其余模型为 6% 到 13%。技能就在眼前,它却每六次就无视一次。
最清楚的证据在任务完成度上。其他所有模型都停在 97。Qwen 停在 88.9,是唯一一个连完成任务的能力也下滑的模型。当我们查看 Qwen 在指令遵循上得分低的场景时,大多数并不是它放弃的情况。在其中 116 个场景里,Qwen 高标准完成了任务,但指令遵循很差,而两者都失败的场景为 87 个。116 这个数字就是整个论点的浓缩。拿到某个工具的约定后,Qwen 常常会按自己的方式造出能用的东西,无视别人要求它如何建造。
添加该技能甚至可能适得其反。对大多数模型而言,该技能几乎从不造成损害;3% 到 6% 的场景出现退步。对 Qwen 而言,14% 的场景退步,其中一些出现灾难性的单次暴跌。一个基线得分为 100 的场景在加入该技能后跌至 4.6。另外两个场景从 88.6 跌至零。该技能不仅未能帮助 Qwen 完成这些任务,反而主动带偏了模型,使其多花费 38% 的轮次和 28% 的成本,却得到更差的答案。如果你在无人值守的情况下运行智能体循环,这种廉价、自信且不服从的组合是表中最糟糕的画像。
所有智能体都会栽跟头的地方:网络研究与抓取
最有价值的发现并非关于某一个模型,而是所有五个模型都以相同方式崩溃的那一簇:网络研究与抓取。将这些技能归为一组——Firecrawl、Tavily、Apify、Browser-use、Brave、Exa 和 LangChain——每个模型的指令遵循能力相对于其在其他任务上的表现都出现崩塌。GLM 下降 20 分,Kimi 27 分,Qwen 15 分,MiniMax 13 分,Sonnet 18 分。按五个模型的平均得分计算,整个测试中最难的场景主要由 Firecrawl 命令行任务和一个 Cloudflare 调查笔记场景占据,后者平均得分仅为 18.9 分(满分 100)。
这也是模型最常越出沙箱的地方:读取未提供给它们的文件、扫描文件系统寻找 API 密钥,或寻找评分标准而非按既定要求解决任务。这些越界标记在集群场景中占 16% 到 36%,而在其他场景中仅为个位数,其中 Sonnet 最严重,达 36%。这一模式与任务性质相符:抓取和搜索技能需要 API 凭证,因此模型会去寻找密钥,而不是仅使用任务提供的内容。
诚实的结论是,网络研究与抓取对每个模型来说都很难,无论开源还是闭源,Sonnet 在这里的栽跟头与开源模型如出一辙。这些任务涉及实时网络调用、漫长的智能体循环,以及容易被表面满足的评分检查。如果你将任何这些智能体部署在抓取或研究类工作负载上,预计其指令遵循能力会比你干净任务上的表现下降 15 到 25 分,并要为偶尔出现成本比中位数高一个数量级的运行做好预算。而且花更多钱也无济于事:输出 token 数和轮次都与 Overall 得分呈轻微负相关,因此那些漫长、昂贵的运行是在错误答案上反复挣扎,而不是在做细致的额外工作。
你应该选择哪个编码智能体?
技能是伟大的均衡器,因此第一条规则就是使用一个。它为每个模型增加约 20 分,其中为 Sonnet 增加最多,达 24.4 分——Sonnet 在基线时处于中游,只有在掌握这些约定后才达到顶级水平。没有该技能,排名会完全重新洗牌。你选择哪个模型几乎完全取决于你是否给它正确的上下文,而这正是将技能视为一等软件这一前提的全部意义所在。
在这一点确定之后,以下是有主见的指导。
如果你想要最高准确率,又不想支付前沿实验室的价格,就选择 GLM 5.2。它位居榜首,是测试中最稳定的模型,且每任务成本低于 Sonnet。对于大多数将 Claude 或 GPT 作为默认选项进行比较的团队来说,这一结果应该改变你的支出方向。
如果你想要 Sonnet 级别的质量,同时希望在强模型中成本最低,就选择 MiniMax M3。它在每任务成本低约 30% 的情况下,与 Sonnet 的差距在一个百分点以内。
如果你已经在 Anthropic 生态系统中,并且看重在典型任务上每个场景的优势,那就选择 Sonnet 4.6。它在正面交锋中赢得的次数最多,在我们的运行中没有拒绝任何请求,并且是输出 token 最精简的模型。你为这种一致性与峰值之间的权衡支付了一点溢价,而在这项测试中,一个开放模型与它不相上下。
在完成比成本更重要的专注编码任务上,选择 Kimi K2.7-code。Kimi 完成任务与领先者一样可靠(96.9 任务完成率);它的弱项是严格遵循指令。按 token 计算,它比 GLM 和 Sonnet 更便宜,因此在短输出工作上,其成本低于 0.66 美元平均值所暗示的水平,但它倾向于运行过长,这使它更适合高价值、低量的工作,而不是大规模部署。
将 Qwen3.7-Plus 视为专家,而非通才。每任务 0.068 美元,它比其他所有模型都便宜得多。但它遵循指令最差,质量也最不稳定。在任务容错率高且节省占主导地位的地方使用它。在按规定方式完成任务确实重要的地方不要使用它。
更广泛的信号是定价页面所忽略的。开源编码代理在准确性上已经追平前沿,而剩下的差距不是能力,而是可靠性。同样的技能让每个模型提升了大致相同的幅度,这意味着差异化因素不再是原始模型质量。而是模型是否听话。
来源:Tessl Blog · tessl.io