跳到正文
Tessl Blog· Rob Willoughby·· 2026-06-13精选AI 评分62

Tessl 实测:Gemini 账单为何与模型命名不符

Why Your Gemini Bill Doesn't Match the Model Names

AI 导读

Tessl 在 OpenHands 中对四款 Gemini 模型各跑约800个任务、共约3300次配对 skill-eval,发现 Gemini 3.5 Flash 每任务成本 $1.05、得分 88.6,而 Gemini 3.1 Pro 每任务 $0.66、得分 87.9,成本排序与命名层级并不一致。

推荐理由

通过约3300次配对实测揭示智能体成本由token消耗和轮数决定,而非模型命名或单价,方法可迁移到自有工作负载。

正文 · AI 翻译

为什么你的 Gemini 账单与模型名称对不上

tl;dr - 在大约 3,300 次配对的技能评估运行中,Gemini 3.5 Flash 每项任务花费 1.05 美元,而 Gemini 3.1 Pro 为 0.66 美元,但两者的得分实际上几乎相同:88.6 对 87.9。

当你查看实际任务成本时,定价显得更加奇怪。Gemini 3.5 Flash 和 Gemini 4.5 Flash 的每任务成本相差近 8 倍,而 Gemini 3.1 Pro 比两者都更便宜。账单似乎并不遵循命名层级。

这些数字从何而来?

该基准测试将每项任务运行两次,一次应用相关技能,一次不应用,涵盖 OpenHands 中的四个 Gemini 模型,每个模型总计约 800 项任务。我们没有依赖仪表盘估算,而是直接从 agent 会话日志中提取每次调用的 token 数量,并使用 Google 公布的每 token 价格计算成本。然后我们比较了各模型由此得出的每任务成本。

核心数据

模型$/任务(含技能)得分每美元得分输入 token轮次标价 $/Mtok
3.1 Flash Lite$0.03570.22,0060.31M17$0.25
3 Flash Preview$0.13585.46330.63M24$0.50
3.1 Pro Preview$0.6687.91320.65M26$2.00
3.5 Flash$1.0588.6851.41M39$1.50

从这些数据中可以明显看出几点。

  • 成本顺序与名称顺序不相关。Gemini 3.1 Pro 的每任务成本比 Gemini 3.5 Flash 更低,尽管其每 token 标价更高;而同属一个产品系列的 Gemini 4.5 Flash 和 Gemini 4.5 Flash-Lite,实际支出却差异巨大。模型名称描述的是预期定位,但它们并不能很好地指导现实世界中的 agent 成本。
  • 得分确实随着每一代模型而提高,这是一个真正的积极趋势,也是跟踪发布的充分理由,但能力提升并不会自动转化为成本降低。
  • 最后,实用价值之选是 Gemini 3 Flash Preview,它与领先模型的得分差距在三分以内,而每任务成本约为后者的五分之一,使其成为可接受 85 分左右得分的工作负载中最具效率的选择。

为什么用量胜过单价

agent 任务成本是两个变量的乘积:

Task cost = price-per-token × tokens the model decides to spend

模型名称确定了第一个变量。第二个变量由模型在特定任务上的运行时行为决定,只有在你阅读会话日志后才会显现。

对于 Gemini 3.5 Flash,每任务成本细分如下:

  • 非缓存输入:$0.72
  • 缓存读取输入:$0.14
  • 输出(包括思考):$0.19

主要驱动因素是输入量。Gemini 3.5 Flash 每项任务在 39 个 agent 轮次中发送了 141 万个 token 的上下文。Pro 在 26 个轮次中发送了大约一半的量,即使其每百万 token 标价更高,为 2.00 美元,其较低的用量也带来了更低的总账单。

一个每 token 费率更低但需要更多轮次才能得出答案的模型,会侵蚀自身的折扣。还值得注意的是,这些运行中 63-75% 的输入是缓存读取,这意味着对轮次数的实际敏感度甚至比原始标价所显示的更高:乘数正在你的会话日志中累积,而不是在你的定价页面上。

技能按层级影响成本

在每次运行中添加相关技能,会根据运行它的模型不同,使每任务成本朝相反方向变化:

  • Pro 的每任务成本下降了 $0.20(-23%),而得分提高了 20 分。该模型使用的轮次更少,探索性回溯也更少,这表明它能够直接依据结构化指导采取行动,而不是通过迭代来发现解决路径。
  • 3.5 Flash 基本持平,成本在两个方向上的变化都不到 $0.03。
  • 3 Flash Preview 和 Flash Lite 各自消耗了略多的 token,换来了微小的得分提升(分别为 +$0.03 和 +$0.01)。

底层规律是一致的:对于能够精确遵循结构化指导的模型,技能会压缩其解决路径,减少轮次,从而降低总成本。而对于仍在通过探索来消解歧义的模型,同样的技能只是为处理过程增加了上下文,而非提供一条可直接应用的捷径,成本保持稳定或略有上升。技能对能力强的模型是捷径,对能力弱的模型则是负担。

从实际角度来看,这产生了两个清晰的运营选择点。配备相关技能的 Pro 每任务 $0.66,是通往顶级性能最具成本效益的路径。配备技能的 Gemini 3 Flash Preview 每任务 $0.135,其每美元得分约为两个领先者中任一方的五倍,而得分仅低三分,这对许多工作负载而言是合理的取舍。

测量,而非假设

从这些数据中得出的四条结论,其适用范围超出了这个特定基准:

1/ 不要依据价目表做预算。 应根据在你特定任务、特定提示词、特定智能体框架下实测的 token 和轮次,来核算你的工作负载成本。每 token 的标价是筛选候选模型的有用初筛条件,但并非相对支出的可靠预测指标。

2/ 在会话层面读取成本。 聚合仪表盘可能显示 $0,而支出却在后台不断累积。用于预算目的时,token 用量必须来自原始 API 响应或智能体会话日志才可信。

3/ 首先关注轮次。 3.5 Flash 与 Pro 之间 39 对 26 的轮次差距,是此处观察到的价格倒挂的主要原因,而轮次是观测工具中最常缺失的变量。它是成本方程中其他一切因素的乘数。

4/ 模型更新时重新测量。 Gemini 3.5 Flash 是比 Gemini 3 Flash Preview 更新的版本,得分也更高,但在这个智能体场景中成本大约高出八倍。能力提升与成本改善是相互独立的变量,任何成本基准都需要随每次版本更新重新运行,而不能假定其保持不变。

注意事项

这些结果来自单一智能体框架(OpenHands)、单一基准(带有明确的技能相关性披露)以及特定的样本窗口。不同的任务、提示词结构和轮次长度模式会改变绝对数值,也可能改变相对排名。需要传承下去的发现不是某个具体的模型推荐,而是一种方法论:在智能体场景中,成本排名无法仅从每 token 费率推导出来,适用于你的工作负载的排名取决于该工作负载的具体行为特征。

模型名称是一个定价层级,而非成本预测。在智能体工作流中,决定性变量是模型为得出答案而选择消耗多少 token,这个数字只有在你运行工作并读取日志之后才可见。价目表只提供了两个输入中的一个;只有测量才能让你同时获得两者。

下一篇:哪些技能真正值得消耗 token?在这些运行中,42% 带来了显著的性能提升,而 5% 则是净开销。我们将在下一篇文章中继续分析。

来源:Tessl Blog · tessl.io