跳到正文
Tessl Blog· Nicolas Fortuin·· 2026-06-18精选AI 评分63

开源编码智能体对比 Sonnet 4.6:GLM 5.2、MiniMax M3、Kimi 2.7 与 Qwen 3.7 实测

Open-Source Agents vs Sonnet 4.6: GLM 5.2, MiniMax M3, Kimi 2.7 and Qwen 3.7 Tested

AI 导读

Tessl 用近 1000 个真实编码场景、每个场景跑两次(无辅助与附带 agent skill),对比 GLM 5.2、MiniMax M3、Kimi K2.7-code、Qwen3.7-Plus 与 Claude Sonnet 4.6。

推荐理由

近千个真实编码场景的对照评测,给出开源模型与 Sonnet 4.6 在质量、成本与指令遵循上的具体差距。

正文 · AI 翻译

一年前,在开源编码模型和大型实验室的前沿模型之间做选择,其实算不上什么选择。你用前沿模型,然后为它付费。开源模型更便宜,而你能感觉到便宜的原因。

这一差距已经缩小。我们用四个开源模型——GLM 5.2、MiniMax M3、Kimi K2.7-code 和 Qwen3.7-Plus——与 Claude Sonnet 4.6 进行了同一套评估:近 1,000 个真实编码场景,每个场景解决两次,一次无辅助,一次由 agent skill 提供该任务的约定。结果并不是一个昂贵模型获胜的简单故事。一个开源模型在质量和成本上同时击败了 Sonnet。另一个是测试中最便宜的,便宜一个数量级,却仍然无法被信任去遵循一条清晰的指令。实际的问题是:如果你今天要选择一个编码 agent,开源距离前沿有多近,它又在哪里仍然会崩溃?

设置:相同的任务,有和没有 skill

每个模型都两次解决相同的场景。基线运行只给模型任务,别无其他。skill 运行给模型相同的任务,外加一个 agent skill,即针对相关工具打包好的约定和指令。比较两次运行可以隔离出一件事:当你把正确的上下文交给模型时,它能提升多少。

我们从两个维度对每次运行评分。指令遵循衡量模型是否按照要求的方式完成任务,使用正确的 API、约定和约束。任务完成衡量工作是否能运行并产生预期结果。总分对两者按四比三加权,偏向指令遵循,因为一个自信地完成错误任务的编码 agent 比一个卡住的 agent 更糟。所使用的任务和 skill 是公开可用的,在 task-evals-for-skills 数据集中,因此你可以自行检查任何场景。

成本是每个任务的平均美元数,根据每个场景测得的 token 数量按真实标价重新计算。四个开源模型在 Fireworks 上按其公布的 Standard 费率运行。Sonnet 4.6 按 Anthropic 的标价计算。我们报告仅解决成本,不包括评分步骤,与本系列其余部分采用相同的惯例。

需要记住的一个数字:在所有模型中,skill 为总分增加了约 20 分,而几乎所有这些增益都在指令遵循上。这些模型本来就能完成大多数任务。它们缺少的是约定,而这正是 skill 所承载的。

五个编码 agent 在准确率上的得分

以下是每个模型在其配对场景上的完整记分板,先是基线,然后是带 skill。

GLM 5.2MiniMax M3Sonnet 4.6Kimi K2.7-codeQwen3.7-Plus
总分91.991.490.888.782.2
总分(基线,无 skill)71.770.566.469.262.7
skill 带来的总提升+20.2+20.9+24.4+19.5+19.5
指令遵循87.487.286.182.577.2
指令遵循(基线)56.255.449.152.845.7
任务完成97.897.097.196.988.9
完成所需轮次18.522.717.727.516.5
每个任务的输出 token 数8,8138,9526,84121,78712,296
标价(输入 / 输出,每 MTok)$1.40 / $4.40$0.30 / $1.20$3 / $15$0.95 / $4.00$0.40 / $1.60
每个任务的成本$0.289$0.207$0.296$0.661$0.068
每美元得分3184423071341,204

在任何分析之前,有两个事实就跳了出来。表格顶部在质量上几乎打平:第一名到第四名只差四分。而成本列跨越了十倍。换句话说,决策不再关乎谁能做这项工作。它关乎你愿意为最后一点准确率付多少钱,以及你实际上能信任哪个模型去遵循指令。

把五个模型按成本和按质量排成一排,其中三个对得起它们的价格:Qwen 在便宜的一端,MiniMax 在中间,GLM 5.2 在顶端。测试中没有任何模型能同时在成本和质量上击败这三者。Sonnet 4.6 不在其中。GLM 5.2 得分一样高,每个任务的成本还略低,所以在这项测试中,没有理由放着它去选 Sonnet。Kimi 是测试中最贵的模型,准确率却只排第四。

与 Sonnet 打平的模型

本系列标题承诺了一个能与 Sonnet 打平的开源模型。数据比这更强。GLM 5.2 的总体得分为 91.9,而 Sonnet 为 90.8,且每个任务成本为 $0.289,而 Sonnet 为 $0.296。在直接比较五个模型都运行过的场景时,GLM 5.2 达到 93.5,Sonnet 为 91.9。这个开源模型在质量和成本上都领先。

有一个细微之处值得精确说明,因为它指向相反的方向,而且比较应当公平。在这些任务中,Sonnet 在 54% 的任务上是单个最佳模型,超过任何其他模型。所以 Sonnet 以微弱优势赢下典型场景。GLM 5.2 在平均值上仍然领先,因为它更稳定:拖低其均值的灾难性低分更少。如果你在意中位数任务,Sonnet 略胜一筹。如果你在意避免糟糕的一天,GLM 5.2 胜出。两种解读都成立,而且都指向顶端真正的平局,而非一边倒。

MiniMax M3 在质量上与 Sonnet 几乎处于同一位置,91.4 对 90.8,而每个任务成本低约 30%。它是榜首的性价比之选。

不听话的模型

Qwen3.7-Plus 是那个警示故事,而有趣之处在于它失败的方式。它并不是一个处处得分都更低的较弱模型。它是一个会干活、但在干活时无视你指令的模型。

从最明显的信号说起。Qwen 在测试中指令遵循得分最低,使用该技能时为 77.2,而其他所有模型都在 82 或更高,基线也最低,为 45.7。但平均值低估了问题,因为 Qwen 的得分波动很大。即便手握该技能,它仍有 16% 的场景在指令遵循上得分低于 50,而其余模型为 6% 到 13%。技能就在眼前,它却每六次就无视一次。

最清楚的证据在任务完成度上。其他所有模型都停在 97。Qwen 停在 88.9,是唯一一个连完成任务的能力也下滑的模型。当我们查看 Qwen 在指令遵循上得分低的场景时,大多数并不是它放弃的情况。在其中 116 个场景里,Qwen 高标准完成了任务,但指令遵循很差,而两者都失败的场景为 87 个。116 这个数字就是整个论点的浓缩。拿到某个工具的约定后,Qwen 常常会按自己的方式造出能用的东西,无视别人要求它如何建造。

添加该技能甚至可能适得其反。对大多数模型而言,该技能几乎从不造成损害;3% 到 6% 的场景出现退步。对 Qwen 而言,14% 的场景退步,其中一些出现灾难性的单次暴跌。一个基线得分为 100 的场景在加入该技能后跌至 4.6。另外两个场景从 88.6 跌至零。该技能不仅未能帮助 Qwen 完成这些任务,反而主动带偏了模型,使其多花费 38% 的轮次和 28% 的成本,却得到更差的答案。如果你在无人值守的情况下运行智能体循环,这种廉价、自信且不服从的组合是表中最糟糕的画像。

所有智能体都会栽跟头的地方:网络研究与抓取

最有价值的发现并非关于某一个模型,而是所有五个模型都以相同方式崩溃的那一簇:网络研究与抓取。将这些技能归为一组——Firecrawl、Tavily、Apify、Browser-use、Brave、Exa 和 LangChain——每个模型的指令遵循能力相对于其在其他任务上的表现都出现崩塌。GLM 下降 20 分,Kimi 27 分,Qwen 15 分,MiniMax 13 分,Sonnet 18 分。按五个模型的平均得分计算,整个测试中最难的场景主要由 Firecrawl 命令行任务和一个 Cloudflare 调查笔记场景占据,后者平均得分仅为 18.9 分(满分 100)。

这也是模型最常越出沙箱的地方:读取未提供给它们的文件、扫描文件系统寻找 API 密钥,或寻找评分标准而非按既定要求解决任务。这些越界标记在集群场景中占 16% 到 36%,而在其他场景中仅为个位数,其中 Sonnet 最严重,达 36%。这一模式与任务性质相符:抓取和搜索技能需要 API 凭证,因此模型会去寻找密钥,而不是仅使用任务提供的内容。

诚实的结论是,网络研究与抓取对每个模型来说都很难,无论开源还是闭源,Sonnet 在这里的栽跟头与开源模型如出一辙。这些任务涉及实时网络调用、漫长的智能体循环,以及容易被表面满足的评分检查。如果你将任何这些智能体部署在抓取或研究类工作负载上,预计其指令遵循能力会比你干净任务上的表现下降 15 到 25 分,并要为偶尔出现成本比中位数高一个数量级的运行做好预算。而且花更多钱也无济于事:输出 token 数和轮次都与 Overall 得分呈轻微负相关,因此那些漫长、昂贵的运行是在错误答案上反复挣扎,而不是在做细致的额外工作。

你应该选择哪个编码智能体?

技能是伟大的均衡器,因此第一条规则就是使用一个。它为每个模型增加约 20 分,其中为 Sonnet 增加最多,达 24.4 分——Sonnet 在基线时处于中游,只有在掌握这些约定后才达到顶级水平。没有该技能,排名会完全重新洗牌。你选择哪个模型几乎完全取决于你是否给它正确的上下文,而这正是将技能视为一等软件这一前提的全部意义所在。

在这一点确定之后,以下是有主见的指导。

如果你想要最高准确率,又不想支付前沿实验室的价格,就选择 GLM 5.2。它位居榜首,是测试中最稳定的模型,且每任务成本低于 Sonnet。对于大多数将 Claude 或 GPT 作为默认选项进行比较的团队来说,这一结果应该改变你的支出方向。

如果你想要 Sonnet 级别的质量,同时希望在强模型中成本最低,就选择 MiniMax M3。它在每任务成本低约 30% 的情况下,与 Sonnet 的差距在一个百分点以内。

如果你已经在 Anthropic 生态系统中,并且看重在典型任务上每个场景的优势,那就选择 Sonnet 4.6。它在正面交锋中赢得的次数最多,在我们的运行中没有拒绝任何请求,并且是输出 token 最精简的模型。你为这种一致性与峰值之间的权衡支付了一点溢价,而在这项测试中,一个开放模型与它不相上下。

在完成比成本更重要的专注编码任务上,选择 Kimi K2.7-code。Kimi 完成任务与领先者一样可靠(96.9 任务完成率);它的弱项是严格遵循指令。按 token 计算,它比 GLM 和 Sonnet 更便宜,因此在短输出工作上,其成本低于 0.66 美元平均值所暗示的水平,但它倾向于运行过长,这使它更适合高价值、低量的工作,而不是大规模部署。

将 Qwen3.7-Plus 视为专家,而非通才。每任务 0.068 美元,它比其他所有模型都便宜得多。但它遵循指令最差,质量也最不稳定。在任务容错率高且节省占主导地位的地方使用它。在按规定方式完成任务确实重要的地方不要使用它。

更广泛的信号是定价页面所忽略的。开源编码代理在准确性上已经追平前沿,而剩下的差距不是能力,而是可靠性。同样的技能让每个模型提升了大致相同的幅度,这意味着差异化因素不再是原始模型质量。而是模型是否听话。

来源:Tessl Blog · tessl.io