跳到正文
Claude.dev 开发者博客· Addy Osmani·· 10 天前精选AI 评分62

Opus 5.5 上一个任务要花多少钱

What a task costs on Opus 5.5

AI 导读

Anthropic 开发者博客解析 Claude Code 在 Opus 5.5 上的单任务成本构成,指出轮次、缓存读取、输出 token 和模型选择四项决定开销,其中输出 token 单价是缓存读取的 100 倍。

推荐理由

官方博客拆解 Claude Code 单任务成本构成,并给出按用量自查与调优的具体方法。

正文 · AI 翻译

一项任务的成本,以及一次重试的成本

你并不是一开始就打算购买数百万个 token。你是为了构建一个功能、完成一次迁移或运行一项任务。token 数量只是模型为达成目标所需的量。

两个每 token 成本相同的模型,在同一任务上的花费可能相差很大。一个只读一次代码。另一个读了代码,尝试修复,然后又读一遍。每一步都是一轮,而每一轮都会重新发送到目前为止的对话。因此,需要更多轮的模型成本更高,即使单价相同。

读完这篇文章,你应该能够回答关于自己工作的三个问题:

  • 我在 Opus 5.5 上执行典型任务要花多少钱?
  • 哪些设置会改变这个成本,改变多少?
  • 我如何查看自己的会话用量?

我想提前说明的权衡是:每一种减少 token 消耗的方式,都可能让你无法完成任务。降低努力程度、使用更小的模型或减少上下文,当然都能节省 token。但一次重试的成本比这些节省更多。本文试图为每一种权衡标出价格。

这里的一些数字是标价,另一些是基于标价构建的示例。这些数字是交互式的,所以你可以在阅读时更改输入。这些是尽力而为的示例,所以请务必查看我们的文档并自行计算。

一项任务要花多少钱?

Claude Code 中的一项任务是一个循环。模型读取对话,调用工具,读取结果,然后再次循环,直到完成。每次循环往返都是一次请求。有四个因素决定循环的成本。

轮次。每一轮都会重新发送到目前为止的对话。轮次越少,处理的输入就越少。

缓存读取。一轮中重新发送的大部分内容,是模型在上一轮已经看过的文本。它按缓存读取计费,价格只是输入价格的一小部分。

输出 token 类型。最昂贵的 token,价格是输入的五倍。思考按输出计费,因此推理更少的模型成本更低。

模型。每个模型都有自己的价格,列在定价页面上,所以你选择的模型决定了每个 token 的价格。

我们的示例使用 Opus 5.5 API 标价:每百万输入 token 4 美元,每百万输出 token 20 美元,每百万缓存读取 0.20 美元。与下面的计算器一样,示例将缓存输入按读取价格计费,其他所有内容按输入价格计费,并省略缓存写入。token 数量仅为示例。

轮次

假设一项任务开始时上下文为 20K token,随着模型读取文件和工具结果,增长到 120K。在 40 轮时,平均每轮发送约 70K token。这项任务大约需要 2.8M 输入 token,尽管对话从未超过 120K。如果 90% 从缓存读取,输入成本约为 1.62 美元。同样的任务在 25 轮内处理约 1.75M token,输入成本约为 1.02 美元。

一轮的成本高于它新增的 token,因为它会重新发送之前的所有内容。所以最便宜的一轮,就是你不需要的那一轮。

一个能减少轮次的习惯,是给模型一种检查自己工作的方式。例如,一个可运行的测试、一次构建,或一个调用端点的脚本。能够检查自己工作的模型会更早发现自己的错误。

一个能一次性收集所需信息并批量调用工具的模型,重新发送的次数也更少。

缓存读取

如果这 280 万输入 token 全部未命中缓存,费用为 $11.20。命中率为 90% 时费用为 $1.62,命中率为 96% 时约为 $0.99。没有其他设置能对输入成本产生如此大的影响。稳定的会话本身就能保持较高的命中率。我将在本文后面介绍一些避免破坏缓存的注意事项。

输出 token

在 Opus 5.5 上,一个输出 token 的成本是一次缓存读取的 100 倍。一个典型任务的 6 万输出 token 花费 $1.20,与从缓存中读取 600 万 token 相同。输出包含思考过程。即使 Claude Code 只向你显示摘要,你也要为全部内容付费。这就是为什么 effort(主要改变模型思考量)对账单影响如此之大。

模型

缓存读取更便宜的模型主要有利于长会话。输出更便宜的模型主要有利于需要大量推理的任务。

OPUS 5.5 有哪些变化

有两处变化:价格,以及模型完成的工作量。

每一项价格都更低了。输入和输出 token 比 Opus 5 便宜 20%。缓存读取便宜 60%。输入价格下降,读取费率也随之下降,从输入价格的十分之一降至二十分之一。图 A 比较了两个模型每百万 token 的价格。这些是 API 标价。在 Pro、Max 或 Team 套餐上,Opus 5.5 更低的价格会体现在你的限额上,包括缓存上下文,因此限额比 Opus 5 大约多出 25%。缓存读取的额外降价属于 API 价格调整。

另外,Pro、Max、Team 和按席位计费的 Enterprise 套餐的五小时限额提高了,符合条件的订阅者还可获得一次限额重置,可自行选择使用时机。你可以在网页版或 Claude Desktop 的 Settings > Usage 下找到它,而不是在终端里的 Claude Code 中。重置会应用于你的整个账户,包括 Claude Code。

Bar chart of API list prices per million tokens, Opus 5 against Opus 5.5: input $5.00 and $4.00, output $25.00 and $20.00, cache reads $0.50 and $0.20, which is 20%, 20% and 60% lower.
图 A每百万 token 的 API 标价。

对于使用 API 密钥的情况,缓存读取降价对 Claude Code 影响最大。长时间智能体会话的大部分输入都花在缓存读取上。在下面图 B 计价的会话中,缓存这一项从 $1.00 降至 $0.40,是账单上降幅最大的一项。

你能节省多少取决于你工作的形态。以缓存读取为主的会话最多可节省 60% 的输入成本。没有缓存、答案很长的简短提问最多可节省 20%,因为输出占主导。大多数 Claude Code 任务介于两者之间。下面的计算器可以显示你的任务处于什么位置。

你可能看到过 Opus 5.5 的运行成本比 Opus 5 低 40%。这是我们对按 token 计费、使用默认设置的典型工作负载的估算。它假设 Opus 5.5 在其默认的 medium 档位下每个任务使用的 token 更少,再加上更低的价格,所以这并不是 token 价格降低了 40%。token 价格就是图 A 中的那些,图 B 显示了价格变化本身带来的影响。

Opus 5.5 在回答时可能使用更多 token,因为它在回复前总会先思考。我们预计人们用 Opus 5.5 能完成更多工作,但这因任务而异,所以请在你自己的工作上衡量。图 C 比较了两个模型每个任务的成本。这部分对工作的依赖远大于对价格的依赖。

在范围明确的任务上,两个模型完成的轮数大致相同,你得到的就是价格下降带来的好处。差距应该在开放式任务上最大,因为模型可能把很多轮花在错误的想法上。没有哪个单一数字适用于所有代码库,所以要实际衡量(见最后一节)。

长时间运行会以一份报告结束。 Opus 5.5 在长时间运行结束时,会说明它改动了什么、发现了什么,以及需要你提供什么。这也能省钱,因为当你能看到发生了什么时,你重新运行会话的频率就会降低。

相同任务并排对比

图 B 以相同的 token 数量为两个模型的一次会话定价。因此差异仅来自价格变化,别无其他。切换模型即可对比。token 数量仅为示意。

$3.50按 Opus 5 API 标价

  • 缓存读取 2.0M$1.00
  • 全新输入 200K$1.00
  • 输出 60K$1.50
  • 总计,Opus 5$3.50
图 B两个模型使用相同 token 的示意会话,因此这仅反映价格变化。

这张账单包含 /usage 为一次会话显示的三行。按 token 计,缓存读取是最大的一行,为 2M。输出按 token 计最小,但按成本计最大。全新输入介于两者之间。它涵盖每个文件的首次读取以及每个新的工具结果。

图 B 为两个模型设定相同的 token 数量,因此它仅显示价格变化。你自己的会话在 Opus 5.5 上可能使用更多或更少的 token。按此定价,该会话成本约降低 31%。

一次有记录的运行还会叠加第二个效应,即模型工作量多少的变化。在出现一次错误开端的任务上,差距应该会拉大。

试试你自己的数字

设定你某个任务的用量,或从预设开始。这些预设相当示意性,但我仍建议你自己算一算。缓存输入按缓存读取价格计费,全新输入按输入价格计费,因此缓存滑块显示差距中有多少来自缓存读取。

要用真实会话填充滑块,请在任务结束时运行 /usage。Session 块会给出输入、输出和缓存数据。最后一个滑块是你对 Opus 5.5 在你的任务上少做多少工作的假设。若只看价格变化,将其保留为 0%。要根据你自己的工作情况设定它,方法如下:在 Opus 5 和 Opus 5.5 上运行同一任务,并比较轮次和输出 token。Measure it yourself 会逐步说明,Reading a session 则展示在 /usage 中应检查什么。

2.2M

所有轮次中发送给模型的内容,无论是否缓存。

91%

60K

包含思考,思考按输出计费。

10

0%

若只看价格,保留为 0%。Opus 5.5 可能比 Opus 5 使用更多或更少的 token,因此请在你自己的任务上测量。

Opus 5,这些 token$3.50每月 $770

Opus 5.5,这些 token$2.40每月 $528

按 API 标价的变化−31%仅因价格,每月少 $242

Opus 5,这些 token:$3.50。Opus 5.5,这些 token:$2.40。按 API 标价的变化:−31%,仅因价格,每月少 $242。

图 C一个月按 22 个工作日计。API 标价。在 Pro、Max 或 Team 套餐上,这不是账单。不含批量或用量折扣,且未计入缓存写入(见 缓存)。

最大化会话价值的技巧

Opus 5.5 更低的价格让每个 token 成本更低。你如何运行会话决定了你使用多少 token,以下步骤会有所帮助。

在更换模型之前先提高 effort

Effort 为模型每轮消耗多少 token 设定了一个总体倾向:包括它的思考、它写出的文本以及它的工具调用。在较低的 effort 下,它进行的工具调用更少,且调用更简短。Opus 5.5 有四个级别(low、medium、high 和 xhigh),外加用于单次会话的 max。在下方选择一个级别,查看何时使用它以及设置它的命令。

Medium:适用于范围明确的日常工作

范围明确的日常工作。它每轮的思考量少于 high,因此每轮成本更低。

当任务范围明确时,从这里开始。

  • /effort medium
  • /effort status
  • /model
  • /usage
图 D级别从每轮思考最少到最多排列。

Claude Code 会为每个模型设置一个默认级别,/effort status 会显示你的级别。对于范围明确的日常工作,试试 medium。当 medium 卡住时,试试 high。它每轮的开销高于 medium,但低于换用更大的模型。对于机械性工作,比如重命名或在多个文件中应用已知模式,使用 low。

在 Opus 5.5 上,默认是 medium,比 Opus 5 的默认级别 high 低一级。级别并不意味着在每个模型上代表相同数量的思考。在给定级别下,Opus 5.5 每轮的思考量都多于 Opus 5,在 xhigh 和 max 时尤为明显。所以不要沿用你为 Opus 5 选择的级别。从 medium 开始,把 xhigh 和 max 留给那些你已测量到收益的工作。

一个粗略理解 effort 定价的方式:假设 high 在一个任务中增加 20K 思考 token。在 Opus 5.5 上那是 $0.40。一个十轮的重试循环,使用 100K 缓存上下文,总共 10K 输出 token,成本大致相同。所以 high 在一个能省下一次重试的任务上就值回成本。而在一个 medium 本可以一次完成的任务上,它就是浪费。

当 medium 只修复了一层时

你需要更高 effort 的最明显迹象是:修复只停留在一层。

假设一个字段在 API handler 中被重命名。在 medium 下,模型更新了 handler,handler 的测试通过了,而客户端仍然发送旧字段。它做了被要求做的事。它只是没有读得足够远,去找到第二个调用方。在 high 下,它会在写入前花更多轮阅读调用点,并在一次处理中修改两层。

一项检查也能捕获同样的 bug。如果模型能运行一个经过客户端的测试,那么在 medium 下,旧字段在写入的那一轮就会让该测试失败。所以在提高 effort 之前,先检查模型是否有办法检查自己的工作。运行一次测试花费一轮及其输出。更高的 effort 会给每一轮都增加思考。

如果升级 effort 级别和增加检查都不起作用,那就换用更大的模型。

在会话中途更改 effort

在 Claude Code 中,运行 /effort 并带上一个级别,例如 /effort high。/effort status 会打印当前级别。你可以在任务中途更改它,新级别会应用于下一个请求。

在 Opus 5.5 上,使用 API key 或 Claude 订阅时,更改 effort 会保留缓存。你可以为一个困难步骤提高它,然后再降低,而无需重写对话。在 Amazon Bedrock、Google Cloud 的 Agent Platform 或 Claude apps gateway 上,更改 effort 仍会清除缓存的对话,下一个请求要为全部内容支付缓存写入费用。Opus 5.5 的思考始终开启,因此没有可更改的思考设置。

为你的工作选择合适的模型

模型选择决定了会话中每个 token 的价格,因此它对账单的影响比 effort 更大。它的影响范围也更广。每个继承主模型的子代理也会继承它的价格。大多数日子需要三种模型:一个用于查找的小模型,一个用于你密切监督的工作的 Opus 5.5,以及一个用于最难任务的更大模型。

Three models in order of cost, with bars that show order of cost only: Haiku or Sonnet for lookups and subagents, Opus 5.5 as the daily driver, and Fable 5.1 for the hardest work, each with the kinds of work it suits.

Opus 5.5 作为日常主力

用 Opus 5.5 处理你监督的工作:跨几个文件的功能开发、调试,以及带有后续修改的代码审查。你阅读它的输出,并在它跑偏时介入,这样循环就能保持简短。

升级到 Fable 5.1

当结果比 token 价格更重要时,升级到 Fable 5.1。例如你不会监督的长时间运行、代码库中没有现成模式的问题,以及需要协调许多子代理的大型改动。不要等到第三次失败。如果 Opus 5.5 在 xhigh 下两次遇到同一个问题,就切换,问题解决后再切回来。对于交互式工作,Opus 5.5 更合适,因为它延迟更低、成本更少。

Fable 5.1 的标价是每百万输入 token 10 美元、每百万输出 token 50 美元,是 Opus 5.5 价格的 2.5 倍。它的缓存读取费用为每百万 0.25 美元,仅为 Opus 5.5 费率的 1.25 倍,因为其计费为输入价格的 0.025 倍。因此,差距在长时间、缓存密集的运行中最小,而在写入量大的任务中最大。

在自然的断点处切换。缓存属于前一个模型,所以预期在新模型上的第一轮要为整个对话支付写入价格。先运行 /compact,或者用一个简短的书面计划开启新会话,让那一轮更小。运行 /model 并带上别名或模型名称来切换。/model 还会把你的选择保存为新会话的默认值,所以困难部分完成后就切回来。

为查找而降级

为查找降级到 Sonnet 或 Haiku,而不是为写代码:负责搜索和总结的子代理、读取日志和测试输出,以及“这个定义在哪里”的问题。对于跨多个文件的机械式编辑,保留 Opus 5.5 并将 effort 设为 low。编辑仍由编写你其余代码的模型完成,每轮成本更低。

要把子代理放到更小的模型上,在其定义中设置 model: haiku 或 model: sonnet。要把每个子代理都放到同一个模型上,设置 CLAUDE_CODE_SUBAGENT_MODEL 环境变量。子代理定义中指定的模型会覆盖该变量。没有模型设置的子代理会运行在你的主模型上,除非设置了该变量。

每个子代理都在自己的上下文窗口中运行,并返回一份摘要,因此它读取的文件不会进入你的主对话。它仍然要为自己的 token 付费,所以模型设置决定了这笔开销的多少。

Agent teams 是一项实验性功能,会放大这一点。每个队友都是一个独立的 Claude Code 实例,拥有自己的上下文窗口,并且会一直消耗 token 直到退出。我们的成本文档指出,当队友以 plan 模式运行时,一个团队大约是一个标准会话 token 量的七倍。保持团队规模小,让每个任务自包含,并在队友的部分完成后将其关闭。

权衡在于:一个小模型如果误读搜索结果,会让主模型去找错误的文件,而主模型要为这段绕路付出代价。让小模型做那些错误容易被发现的工作,比如查找文件、运行测试和读取日志。

把判断权留给主模型。opusplan 别名以另一种方式拆分工作:Opus 在 plan 模式下制定计划,Sonnet 执行计划。这会把代码编辑交给 Sonnet,与上面的建议正好相反。在将其设为默认之前,先在你自己的任务上衡量一下。

迁移时检查你的提示词

为旧模型编写的指令会让 Opus 5.5 写更多内容并重复调用工具。在 Claude Code 中运行 /claude-api prompt-audit,检查你的 Claude Code 设置(例如你的 skills 和 CLAUDE.md 文件)中是否存在这些提示词反模式。它还会检查你在 Claude Platform 上构建的应用的代码。

我们在一次从 Opus 4.8 到 Opus 5.5 的迁移中测试了这一点,使用了一个包含 44 个工单的内部客户支持基准,其提示词中存在若干此类模式。迁移到 Opus 5.5 并在低 effort 下运行,使该基准的成本降低了约 18%。运行 prompt-audit 又进一步降低了 9%,最终比 Opus 4.8 的起点低约 25%。该审计移除了那些让模型写更多内容并重复调用工具的仪式性指令:一个强制性的六步流程、一条草稿纸规则、一条验证两次规则,以及相互矛盾的指令。

该结果来自一个基准,因此请将其视为示例,而非可预期的数字。运行审计,然后在真实任务上比较运行前后的 /usage(参见自行衡量)。

缓存与压缩

Claude Code 会为你处理缓存和压缩。你如何运行会话决定了它们能节省多少。

缓存如何工作

Claude Code 会缓存请求中重复的部分,例如系统提示词、工具定义以及到目前为止的对话。

在 Opus 5.5 上,一次缓存读取的成本是全新输入 token 的 5%。写入缓存的成本高于全新读取,按当前定价,五分钟缓存为输入价格的 1.25 倍,一小时缓存为输入价格的两倍。每次命中都会免费重置生命周期。

在 Claude Code 中,生命周期取决于你的付费方式。使用 Claude 订阅时为一小时。使用 API key 或云服务商时默认五分钟,而订阅在开始消耗用量额度后会降至五分钟。

在 120K token 的上下文下,Opus 5.5 上五分钟写入的成本约为 $0.60,读取约为 $0.02。一次写入的成本相当于 25 次读取。使用 API key 时,一次六分钟的咖啡休息会把下一次 $0.02 的读取变成 $0.60 的写入。同样大小的一小时写入成本约为 $0.96,在 API 上你可以支付这一溢价来覆盖一天中的空档。

会话形态与命中率

缓存存储的是前缀,因此它只能复用请求中从开头起与上一次匹配的部分。

稳定的会话会在每一轮向对话末尾追加内容,并保持较高的命中率。任何改变请求较早部分的操作都会降低命中率。更改工具定义会清空整个缓存,而更改系统提示词会从该点起清空缓存,这几乎就是全部内容。

在实践中,以下情况预计会发生缓存写入:

  • 你暂停的时间超过缓存生命周期;
  • 你在 Amazon Bedrock、Google Cloud 的 Agent Platform 或网关上更改 effort,因为该级别是缓存匹配内容的一部分;
  • 你在一次对话中首次开启 fast 模式,这会改变缓存匹配的部分内容;
  • 你连接或断开 MCP 服务器,这可能改变每次请求开始时加载的内容;
  • 你切换模型,因为新模型从空缓存开始;以及
  • 对话被压缩,这会重写缓存所匹配的历史记录。

所以在会话开始时设置好这些,然后在它工作期间不要改动它们。

为什么长会话每轮成本更高

每一轮都会重新发送整个上下文,因此随着上下文增长,每轮的成本也会增加,即使缓存是热的。在 20K token 的上下文下,一轮的缓存读取在 Opus 5.5 上花费约 $0.004。在 150K 时花费约 $0.03,而在该规模下 30 轮仅读取就花费 $0.90。同样的 30 轮在 20K 下花费约 $0.12。在 Claude 4.6 及之后的模型上,更大的上下文窗口不会改变每 token 的价格,因此成本完全来自重新发送对话。

其中大部分上下文是早期工作遗留下来的:一小时前的堆栈跟踪、你已经处理完的文件、你已经修复的测试运行的输出。每一轮仍然会发送所有这些内容。

压缩、/compact 和 /clear

当会话接近其上下文限制时,Claude Code 会总结较早的历史记录,以便后续轮次发送更少的内容。运行 /autocompact 并带上一个 token 数,可以更改在触发压缩之前上下文达到多满。

有两个命令可以让你自己来做这件事。/clear 会清空对话且不产生费用,所以当你转向无关工作时使用它。/compact 保持连续性,并产生一次请求的费用。它会读取它所总结的对话,你可以说明要保留什么,例如 /compact keep the failing test names and the schema change。

在 150K token 时进行压缩的大致价格约为 $0.25。这包括读取、几千个输出 token 的摘要,以及在更短上下文上的一次新的缓存写入。之后每一轮在读取上节省约 $0.025,因此压缩大约在十轮内就能收回成本。在你即将完成之前进行压缩,花费会超过它节省的。

这个价格假设缓存是热的。当缓存是热的时,摘要请求会从缓存中读取对话,所以在休息之前压缩,而不是在休息之后。在超过缓存生命周期的休息之后,同样的 /compact 会再次读取整个对话并将其写回缓存。在 150K token、五分钟缓存的情况下,仅输入就约为 $0.75。如果你已经走上了一条想放弃的路径,请改用 /rewind 回到较早的一轮。当缓存是热的时,这会返回到一个已经被缓存的前缀。

摘要也会丢失细节。在调试会话中途进行压缩可能会丢掉那行关键的日志。在自然的停顿处进行压缩,并且当下一步依赖于某些具体内容时,在 /compact 指令中说明。

在你输入之前加载的内容

你的 CLAUDE.md 文件 会在每个会话开始时加载到上下文中,因此其中的每一行都是每一轮重新发送内容的一部分。成本文档 建议将其保持在 200 行以内。MCP 工具定义是延迟加载的。开始时只加载工具名称和服务器指令,当使用某个工具时才加载其完整定义。运行 /mcp 查看哪些服务器已连接,并关闭你不使用的那些。

账单的其余部分

下表列出了影响 Claude Code 会话的其他计费规则,并在有文档的地方附上了链接。

快速模式让 Opus 5.5 的运行速度最高提升 2.5 倍,价格为标准价格的两倍:每百万输入 token $8,每百万输出 token $40。在 Claude 订阅上,它从使用额度中计费,而不是你的套餐限额。开启它后的第一个请求会按快速模式的输入价格对整段对话计费,且不使用缓存。因此请在会话开始时开启它,而不是在会话进行到深处时。

账单计算的内容工作原理
缓存生命周期在 Claude Code 中,订阅用户为一小时;使用 API 密钥或云提供商时为五分钟,或者当订阅开始消耗使用额度时。每次命中都会重置生命周期。API 以更高的写入价格提供一小时缓存。成本文档(Claude Code 生命周期)和提示缓存文档
缓存写入按当前 API 定价,五分钟缓存为输入价格的 1.25 倍,一小时缓存为 2 倍。定价文档
思考按输出 token 计费,包括未返回给你的思考内容。扩展思考文档
努力程度适用于每个输出 token:文本、工具调用和思考。努力程度文档
自动压缩在上下文窗口接近其限制时运行。使用带 token 数量的 /autocompact 设置阈值。上下文窗口文档
子代理和代理团队子代理在自己的上下文窗口中工作并返回摘要。计划模式下的代理团队使用的 token 量约为标准会话的 7 倍。上下文窗口和成本文档
批处理 API通过 Message Batches API 发送的请求,输入和输出 token 半价。批处理文档
当前典型支出平均值:在企业部署中,每位开发者每个活跃日约 13 美元。对于 90% 的用户,成本保持在每个活跃日 30 美元以下。这两个数字均针对当前模型。公开文档,成本页面(企业平均值和 90% 上限)

自行测量

本文中的数字仅为示例。你的代码库、提示和习惯各不相同,因此请在你自己的任务上测量成本。以下是检查方法。

  1. 在会话中,运行 /usage。/cost 的作用相同。Session 块显示 token 使用量和按标价估算的美元成本。提示缓存行显示有多少输入来自缓存。在 Pro、Max、Team 或 Enterprise 计划中,同一屏幕会显示你的计划使用量条。美元数字是在你的机器上按标价计算的,因此在订阅计划中,它只是你做了多少工作的参考,而不是账单。
  2. 将同一任务运行两次。Opus 5.5 需要 Claude Code v2.1.280 或更高版本,因此请先运行 claude update。从你的待办事项中选一个,而不是玩具示例。使用 /model 在 Opus 5 和 Opus 5.5 之间切换。记录每次运行的轮次、输出 token 和成本。在得出结论之前,先做三到四个任务。
  3. 对于团队,使用使用量和成本报告。Claude Code Analytics API 提供每位用户的估算成本。Usage and Cost API 按模型以及缓存与未缓存 token 细分支出。
  4. 尝试努力程度阶梯。将一个困难任务分别在 medium 和 high 下运行。将一个机械性任务在 low 下运行。

解读会话

在任务结束时,在 /usage 中检查三件事。

  • 缓存占比。对于长会话,它应该很高。如果很低,请查找长时间暂停、模型切换、中途连接的 MCP 服务器,或者在云提供商或网关上,努力程度的变化。提示缓存行通常会指出最近一次未命中的可能原因。
  • 输出与输入之比。小改动却产生大量输出,通常意味着努力程度对该任务来说过高,或者模型正在重试。
  • 总输入与对话规模之比。如果总输入是对话规模的许多倍,说明会话经历了许多轮次,值得阅读对话以找出循环重复的位置。

作为基准,Claude Code 的成本文档给出的企业部署平均值约为每位开发者每个活跃日 13 美元,而 90% 的用户每个活跃日低于 30 美元。如果某次会话的成本远高于你自己的正常水平,那就值得回顾一下。

请记住

  • 对于范围明确的日常工作,使用中等投入。
  • 给模型一种检查其工作的方法,并在计划模式下开始跨文件的更改。
  • 当中等投入停滞时,将投入提高到高。使用 API 密钥或订阅时,这一更改会保留你的缓存。在云服务提供商或网关上,请在休息时更改。
  • 如果 xhigh 两次遇到同一问题,请切换到 Fable 5.1。问题解决后再切换回来。
  • 将搜索和读取日志的子代理放在 Sonnet 或 Haiku 上。将代码编辑保留在 Opus 5.5 上。
  • 让长时间会话持续进行,以保持其缓存处于热状态。
  • 在不相关的任务之间使用 /clear,并在休息时使用 /compact,同时注明要保留的内容。
  • 最重要的一点:在每个模型上运行一个真实任务,并比较 /usage 报告的内容。你自己的数据才是值得信赖的。

希望这篇文章对你有帮助。如果你在 Opus 5.5 上的限制并不比在 Opus 5 上更宽松,请通过 /feedback 告诉我们。

延伸阅读:有效管理成本 · 模型配置 · 在 Claude Code 中选择 Claude 模型和投入级别 · 投入 · 提示缓存 · 最大化你的 Claude Code 会话价值

感谢 Michael Segner、Kacie Jenkins 和 Molly Vorwerck 的审阅。

来源:Claude.dev 开发者博客 · claude.dev