跳到正文
Tessl Blog· Nicolas Fortuin·· 2026-06-26精选AI 评分59

智能体模型能有多小?Nemotron 的能力下限评测

How Small Can an Agent Model Get? The Nemotron Floor

AI 导读

Tessl 在真实编码任务上评测 NVIDIA 开源权重 Nemotron 系列,发现模型尺寸不是微调质量的旋钮而是阈值:最小的 Nano 12B 无法驱动智能体循环,未产出任何可评分结果。

推荐理由

通过同一套真实编码任务对比 NVIDIA Nemotron 两个尺寸,给出智能体模型存在能力下限这一可迁移的选型视角。

正文 · AI 翻译

大多数模型对比都在问哪个模型最好。这一次,我们要从一个连一个结果都没产出的模型说起。

我们在真实世界编码任务的基准测试中测试了 NVIDIA 的开源权重 Nemotron 系列,从 30B Nano 到 120B Super:这些模型正是预算紧张的独立开发者,或是希望削减推理成本并将数据留在内部的企业会运行的。

主要发现是,模型规模不是用来微调以换取更好质量的旋钮,而是一道门槛。低于某个能力下限,模型根本无法驱动智能体循环,这就是为什么我们尝试的最小变体 Nano 12B 没有产出任何可评分的结果。

超过这道门槛后,问题就不再是哪个模型最便宜,而是哪个模型能跨过你的工作真正需要的标准:Nano 30B 是处理狭窄、范围明确任务的极廉价主力,而 Super 120B 才是能胜任高要求多步智能体工作的规模。

智能体规模下限是指模型能够可靠完成智能体所依赖的“行动-观察-决策”循环所需的最低模型能力。低于这个下限,你得到的不是更慢或更粗糙的智能体,而是一个非智能体:一个读取任务、走几步、却永远无法收敛的模型。对于任何选择模型的人来说,这把问题从“哪个更便宜”变成了“哪个能跨过我的工作的门槛”,而这是首先要回答的问题。

数字从何而来

评估中的每个场景都是与已发布技能绑定的真实世界智能体任务,从两个维度评分:指令遵循(智能体是否按被告知的方式做被告知的事)和任务完成(是否达成目标)。总分中指令遵循权重为 4,任务完成权重为 3,然后除以 7。每个任务都在有技能和无技能两种情况下运行,因此技能带来的提升可以直接看到。任务和技能都是公开的,在 task-evals-for-skills 数据集中,因此你可以自行检查任何场景。

这种设计是有意为之。任务源自已发布的技能,因此它们反映的是团队为其编写技能的工作,而非刻意设计的基准谜题。这改变了低分的含义。对于能完成工作的模型,剩下的差距是指令遵循:按被要求的方式完成工作。对于连普通工作都无法达成目标的模型,问题比指导更根本。

两个模型都以相同方式提供服务,即在 Bedrock 上运行 OpenHands,并由相同的评判者评分,这为每个模型留下了近千个配对场景。以下所有对比都是 NVIDIA 内部的同类比较,没有跨测试框架的混淆,也没有需要协调的供应商定价。成本是每个任务仅解决时的美元数,取自每次运行实测的 token 用量。两个模型都没有触发任何评分规则钻空子标记。

两种规模,两堵不同的墙

以下是主要结果,基线 → 使用技能后。

类别目标完成指令遵循总体$/任务近乎零解决(总体 < 25)
Super 120B68.4 → 69.331.3 → 49.247.2 → 57.80.08319% → 22%
Nano 30B46.6 → 51.319.0 → 26.030.8 → 36.80.04043% → 38%

这两种规模因不同原因触及各自极限。Super 120B 基本能完成。它的目标完成接近 69,技能几乎无法推动它,仅增加 0.9 分。它挣扎的是按规定方式完成任务:技能增加了 17.9 分的指令遵循。Super 具备能力,并从技能提供的指导中受益。

较小的模型 Nano 30B 则面临相反的问题。可靠完成正是它摇摆不定的地方。目标完成度为 46.6,其基线尝试中有 43% 返回接近零的结果。它离底线太近,以至于循环本身才是瓶颈,而不是答案的格式。

这些平均值中隐藏着一种模式,它和平均值本身一样重要。使用这些智能体时,你很少会得到平庸的运行结果。你大多会得到一个接近完成的结果,或者一次近乎彻底的失败。使用该技能时,Super 在 40% 的任务上得分达到 75 或以上,并在 22% 的任务上严重失手。Nano 则呈现出相反的形态:它仅在 11% 的任务上达到上限,并在 38% 的任务上严重失手。规模并不会让智能体温和地变好。它改变的是你在大多数时候得到两种结果中的哪一种。这就是为什么平均值对任何单次运行来说只是一个粗略的参考:"大多很棒"和"大多崩坏"的平均值,是一个在任何给定运行中很少真正出现的数字。

这也意味着 Nano 并非全面薄弱。在范围明确的任务上,比如调用有文档的 API 或遵循专注的文档检索技能,它足够频繁地越过可用门槛,值得一看。它的麻烦在于更长的、多步骤的工作,它可能在那里挣扎。

规模在哪里有帮助,技能在哪里有帮助

规模和技能并不是对同一问题的竞争性答案。它们做不同的工作,而评估显示了各自在哪里见效。我们一直对自己讲述的那个熟悉的故事是,一项相关的技能可以让更便宜的模型追上更贵的模型。这成立,但有一个条件:模型首先必须足够有能力去执行该技能。

先从规模所做的工作说起。从 30B 到 120B,参数增加 4 倍,在基线上换来 16.4 个总体分。这是规模把模型带过底线,带到它至少能完成任务的地方。给 Nano 30B 添加一项技能换来 6.0 分,但它仍然低于完全没有技能的 Super(47.2)。在底线之下,还没有足够的能力让技能去建立在其上。

技能是一个乘数,而在底线之上的模型上,这个乘数可以很大。同一项技能让 Super 在指令遵循上提升 17.9 分,却几乎没怎么影响它的目标完成度(提升 0.9)。这反映了 Super 有增长空间的地方。它已经能完成大多数任务,所以技能的增益体现在指令遵循上,而不是完成度上。技能也能帮助模型完成;只是 Super 剩下的完成度提升空间很小。两者是一个序列,而不是一场竞赛。先让模型越过底线,然后技能就会带来超额的回报。

这种效果在逐项技能上最为明显,它显示了技能能为一个有能力的模型做多少事。一项 Brave Search 位置技能为 Super 增加 76 分的指令遵循。一项 Neon 认证技能增加 68 分。在 Nano 上,同样的技能只增加 1 分和零分,因为还没有能力让这些指导落地。把技能匹配给一个能执行它的模型,回报是巨大的。

单个任务也讲述了同样的故事。在 stripe_ai_upgrade-stripe 场景中,该技能让 Super 从彻底失败变为完美的 100 分,而同样的技能在同样的任务上让 Nano 停留在 0 分。技能在第一种情况下做了工作,在第二种情况下则没有可建立的基础。在整个集合中,有 163 个任务 Super 越过了可用门槛而 Nano 返回接近零的结果,这是仅靠技能无法弥合的那种差距。

在投入程度上也出现了同样的模式。Nano 30B 比更大的模型需要更多轮次(带技能时 29.9 轮,而 Super 为 24.5 轮),得分却只有大约一半。它的轮次分为两种习惯:当它彻底失败时,它很快放弃,大约十轮左右;而当它真正投入时,它会苦干三十轮甚至更多,以达到一个中等的成绩。在门槛之下,额外的指导会增加轮次和成本(从 24.7 到 29.9,成本上升 25%),却没有相应的收益,因为模型还无法高效地执行这些指导。在门槛之上,模型能让技能的指令发挥作用;在门槛之下,能力必须先跟上。

当更便宜的模型未必是更划算的选择

这正是许多团队在做出自托管决策时直觉会出错的地方。Nano 每项任务的成本是 Super 的一半,0.040 美元对 0.083 美元,所以自然的结论是 Nano 更划算,而 Super 是只有在万不得已时才选择的选项。

每项任务的价格忽略了一件事:失败。带技能时,Nano 在 38% 的任务上返回近乎为零的结果,而 Super 为 22%。每一次失败都是一次重试,而重试的成本是每项任务价格从未体现的。把它们算进去,那个每项任务看起来更便宜的模型,最终可能让你为每一个真正可用的结果付出更多。

按每美元得分来看,Nano 像是捡了个便宜,928 对 Super 的 694。但这个数字只奖励便宜,不奖励质量:一个经常做错事但极其便宜的模型,仍然能在这个指标上得分很高。所以先确定你需要的质量,再比较价格。

成本也只是决策的一半。另一半是契合度。Nano 的低价来自它能可靠完成的界定清晰的任务,而在更长的、多步骤的工作上,Super 值得你为之付费。价值在于让每个模型匹配它能胜任的工作,而不是把某个模型称为最便宜的。

哪种规模适合你的工作?

这些发现可以归结为一条简单的经验法则。当任务狭窄且界定清晰时,选择 Nano 30B:一次有文档记录的 API 调用、一项聚焦的文档检索工作,或一次单文件修改,以高频率运行,且可以接受一个勉强及格的结果或一次便宜的重试。它每项任务的成本只有一半,而且小到可以在消费级硬件上自托管,这使它成为真正的干活主力。

当工作是多步骤或更长周期的、当结果必须在第一次尝试时就可用、或者当你无法预测即将到来的任务形态时,选择 Super 120B。它是第一个能可靠越过真实智能体工作门槛的开源权重规模,也是任何要投入生产的工作的起点。

找到你的门槛

这项研究之所以存在,只是因为 NVIDIA 提供了一条你可以自托管的开源权重规模阶梯。这让你能把模型与工作匹配,只在较小的模型无法越过你的质量门槛时才升级。要带走的框架是「最小可用智能体」,而不是纸面上最快或最便宜的。

所以,在选择模型时,不要从价格或参数数量开始。那个在账单上看起来划算的模型,可能正是悄悄让你付出代价的那个。拿出你真正需要完成的工作,设定它必须越过的质量门槛,然后衡量哪些模型能成功越过它。这种比较才能预测什么对你真正有效,值得在你确定某个模型之前先做一遍。一旦做出决定,Tessl Registry 就是你能找到技能、让它走完剩下路程的地方。

来源:Tessl Blog · tessl.io