跳到正文
Tessl Blog· Rob Willoughby·· 2026-06-10精选AI 评分67

同等质量、四分之一成本:DeepSeek V4 Flash 是否值得选

Same quality, a quarter of the cost: Should DeepSeek Flash be your model of choice?

AI 导读

Tessl 用同一评测框架跑了 19 种模型配置,在真实智能体任务上 DeepSeek V4 Flash 单任务成本 0.0236 美元、得分 82.3,Claude Haiku 4.5 为 0.10 美元、82.9 分,Sonnet 4.6 为 0.30 美元。

推荐理由

原文用同一评测框架对比多款模型的单任务成本与得分,并给出按轮次而非 token 做成本监控的方法。

正文 · AI 翻译

$0.0236 是 DeepSeek V4 Flash 在 Fireworks 价目表上运行一个完整智能体任务(含技能)的成本。Claude Haiku 4.5 完成同一任务需 $0.10。Sonnet 4.6 需 $0.30。

就表现而言,在我们的评估中 Flash 得分为 82.3,Haiku 得分为 82.9。因此评估表明,在应用技能的情况下两者表现相当,但其中一个的成本是另一个的四倍。

在我们的评估中,我们用同一个基准测试框架运行了 19 种模型配置。我们要求它们完成的是真实的智能体任务,我们测量了总 token 数,并查看了服务商的计费价格。说实话,我们原本预期会发现“便宜模型是个陷阱”。但我们发现的情况更有趣,如果你在运行任何规模的智能体,这尤其有用。

首先,Pro 对比

DeepSeek V4 提供两个层级:Pro 和 Flash。在我们的评估运行中,Pro 成本为 $0.183/任务,Flash 成本为 $0.0236/任务。这是同一模型家族内 7.7 倍的价格差距。

当你审视多花的钱换来了什么时,只有三分。在评估结果中,Pro 得分为 85.3,Flash 得分为 82.3。换算下来,每月 10,000 个任务每年多花 $19,000,每月 100,000 个任务每年多花 $190,000。为了三分,从质量角度看可能不太明显。

每美元得分

当我们看每评估分对应的成本时,这给出了质量与成本之间的比率,只要模型的整体质量满足你的需求,这可能很有用。

模型得分(含技能)$/任务分/$
DeepSeek V4 Flash82.3$0.0243,482
Haiku 4.582.9$0.097829
DeepSeek V4 Pro85.3$0.183467
GLM 5.190.4$0.200451
Sonnet 4.690.8$0.296303

你的成本模型可能遗漏的数字

每 token 成本是每个人都会引用的数字,也常被误用为做决策时最重要的因素。如果你不关注每次求解的轮数,它也是会悄悄让你的预算爆表的数字。

tokens/turn

Flash 的平均值约为每个任务 20 轮,这相当可控。但我们数据集中最糟糕的单次运行达到了大约 10 倍。这对这一级别的模型来说并不罕见,但以美元计算,那就是单个任务的成本相当于 10 个平均任务。将其乘以数千个并发的智能体运行,你可能就会开始遇到预算问题,而这个问题并没有出现在你的每 token 估算中。

大多数团队没有发现这一点的原因是,智能体框架默认会显示 token 数。而轮数——这个真正驱动肥尾成本爆炸的变量——通常需要显式记录。

为你的智能体埋点监控轮数,而不仅仅是 token。了解你的中位数和第 95 百分位数。根据第 95 百分位数而非中位数来设置超时策略,否则你要么会终止有效的运行,要么会承受意外账单。

技能完成了一半的工作

这里有一件事值得非常直接地说明:Flash 的 82.3 分是技能增强后的得分。没有技能时,Flash 得分为 64.1。技能增加了 +18.2 分。

这种提升是真实的,但非常取决于技能是否精确、范围界定良好,并且确实与任务相关。模糊的技能会把你拉回接近 64.1 的基线,而精准的技能则能让你达到 82.3。

这一点比大多数模型评估所承认的更重要,因为你在 playground 中测试的模型通常不使用技能或相关上下文,而只是原始能力。

更进一步:寻找更便宜的模型并亲自测试它们

上面的分析展示了我们测到的最便宜的托管方案。但如果你想更进一步,有两个显而易见的后续步骤,而且两者都比你想的要容易实现。

这个基准测试中所有不是 GPT、Anthropic 或 Gemini 的模型都有公开可用的权重。DeepSeek V4 Flash、GLM 5.1,你都可以自己运行。自己运行时,边际 token 成本会降到接近零。你付的是算力费用(租 GPU 或自有基础设施),而不是按调用次数计费。

自托管只有在超过一定用量阈值时才划算,运维开销和 GPU 成本当然不是免费的,但如果你每月运行数万个 agentic 任务,盈亏平衡点会比你预期的更低。

这个基准测试中的技能带来了 +18.2 分的提升。值得问的问题是:这个技能从何而来,你又怎么知道它真的靠谱?

Tessl registry 是一个不错的起点,可以查看你技能的质量、影响力和安全状况。在从零开始写技能之前,先检查是否已经存在一个,并且背后有 eval 数据支撑。

正确地评估你的技能。你可以运行两种评估:review(对技能结构是否良好的自动化质量评估)和 task eval(端到端运行,衡量技能是否真正提升了 agent 在真实任务上的表现)。task eval 的输出正是 Flash 基准测试所依赖的那种“有技能 / 无技能”差值。

把技能质量作为模型选择的输入。Flash 从一个范围界定良好的技能中获得的 18 分提升并不是一个固定数字,它取决于技能和任务。一个经过 Tessl 评估且 task eval 得分很高的技能,能让你确信这个提升是真实且可复现的。一个从未被评估过的技能,是你在成本建模中无法计入的变量。

用你自己的负载,而不是别人的基准测试。task eval 系统让你可以从自己的实际代码库中定义场景并运行它们。这就是上面描述的自评估框架。

直接说结论

  • DeepSeek V4 Flash 以 $0.0236/任务 成为性价比之选。Haiku 贵 4 倍,只多 0.6 分。Pro 贵 7.7 倍,只多 3 分。
  • 在按成本排名之前先设定质量下限。pts/$ 会美化又便宜又弱的模型。80 分以上才是真正的信号。
  • 要监控轮次,而不只是 token。你的第 95 百分位轮次数是没人记录的预算变量。
  • 技能承担了一半的工作。糟糕的技能会让你的分数跌回基线。评估你的技能——用 task eval,而不是凭感觉。
  • 你可以自己运行这套流程。20-30 个任务、轮次日志、一张电子表格,再加上 Tessl 的 eval 系统。
  • 自托管开源模型是一个真实可行的选项。权重是公开的,运维上的权衡也是真实的。你应该用自己的模型运行自己的 eval,看看它们能否被替换进来。

档位名称告诉你 Flash 很便宜;数据表明它也很优秀。现在你有了工具,可以去验证这一点是否适用于你正在构建的东西。

来源:Tessl Blog · tessl.io