Opus 5.5 上一个任务要花多少钱
What a task costs on Opus 5.5
Anthropic 开发者博客解析 Claude Code 在 Opus 5.5 上的单任务成本构成,指出轮次、缓存读取、输出 token 和模型选择四项决定开销,其中输出 token 单价是缓存读取的 100 倍。
官方博客拆解 Claude Code 单任务成本构成,并给出按用量自查与调优的具体方法。
一项任务的成本,以及一次重试的成本
你并不是一开始就打算购买数百万个 token。你是为了构建一个功能、完成一次迁移或运行一项任务。token 数量只是模型为达成目标所需的量。
两个每 token 成本相同的模型,在同一任务上的花费可能相差很大。一个只读一次代码。另一个读了代码,尝试修复,然后又读一遍。每一步都是一轮,而每一轮都会重新发送到目前为止的对话。因此,需要更多轮的模型成本更高,即使单价相同。
读完这篇文章,你应该能够回答关于自己工作的三个问题:
- 我在 Opus 5.5 上执行典型任务要花多少钱?
- 哪些设置会改变这个成本,改变多少?
- 我如何查看自己的会话用量?
我想提前说明的权衡是:每一种减少 token 消耗的方式,都可能让你无法完成任务。降低努力程度、使用更小的模型或减少上下文,当然都能节省 token。但一次重试的成本比这些节省更多。本文试图为每一种权衡标出价格。
这里的一些数字是标价,另一些是基于标价构建的示例。这些数字是交互式的,所以你可以在阅读时更改输入。这些是尽力而为的示例,所以请务必查看我们的文档并自行计算。
一项任务要花多少钱?
Claude Code 中的一项任务是一个循环。模型读取对话,调用工具,读取结果,然后再次循环,直到完成。每次循环往返都是一次请求。有四个因素决定循环的成本。
轮次。每一轮都会重新发送到目前为止的对话。轮次越少,处理的输入就越少。
缓存读取。一轮中重新发送的大部分内容,是模型在上一轮已经看过的文本。它按缓存读取计费,价格只是输入价格的一小部分。
输出 token 类型。最昂贵的 token,价格是输入的五倍。思考按输出计费,因此推理更少的模型成本更低。
模型。每个模型都有自己的价格,列在定价页面上,所以你选择的模型决定了每个 token 的价格。
我们的示例使用 Opus 5.5 API 标价:每百万输入 token 4 美元,每百万输出 token 20 美元,每百万缓存读取 0.20 美元。与下面的计算器一样,示例将缓存输入按读取价格计费,其他所有内容按输入价格计费,并省略缓存写入。token 数量仅为示例。
轮次
假设一项任务开始时上下文为 20K token,随着模型读取文件和工具结果,增长到 120K。在 40 轮时,平均每轮发送约 70K token。这项任务大约需要 2.8M 输入 token,尽管对话从未超过 120K。如果 90% 从缓存读取,输入成本约为 1.62 美元。同样的任务在 25 轮内处理约 1.75M token,输入成本约为 1.02 美元。
一轮的成本高于它新增的 token,因为它会重新发送之前的所有内容。所以最便宜的一轮,就是你不需要的那一轮。
一个能减少轮次的习惯,是给模型一种检查自己工作的方式。例如,一个可运行的测试、一次构建,或一个调用端点的脚本。能够检查自己工作的模型会更早发现自己的错误。
一个能一次性收集所需信息并批量调用工具的模型,重新发送的次数也更少。
缓存读取
如果这 280 万输入 token 全部未命中缓存,费用为 $11.20。命中率为 90% 时费用为 $1.62,命中率为 96% 时约为 $0.99。没有其他设置能对输入成本产生如此大的影响。稳定的会话本身就能保持较高的命中率。我将在本文后面介绍一些避免破坏缓存的注意事项。
输出 token
在 Opus 5.5 上,一个输出 token 的成本是一次缓存读取的 100 倍。一个典型任务的 6 万输出 token 花费 $1.20,与从缓存中读取 600 万 token 相同。输出包含思考过程。即使 Claude Code 只向你显示摘要,你也要为全部内容付费。这就是为什么 effort(主要改变模型思考量)对账单影响如此之大。
模型
缓存读取更便宜的模型主要有利于长会话。输出更便宜的模型主要有利于需要大量推理的任务。
OPUS 5.5 有哪些变化
有两处变化:价格,以及模型完成的工作量。
每一项价格都更低了。输入和输出 token 比 Opus 5 便宜 20%。缓存读取便宜 60%。输入价格下降,读取费率也随之下降,从输入价格的十分之一降至二十分之一。图 A 比较了两个模型每百万 token 的价格。这些是 API 标价。在 Pro、Max 或 Team 套餐上,Opus 5.5 更低的价格会体现在你的限额上,包括缓存上下文,因此限额比 Opus 5 大约多出 25%。缓存读取的额外降价属于 API 价格调整。
另外,Pro、Max、Team 和按席位计费的 Enterprise 套餐的五小时限额提高了,符合条件的订阅者还可获得一次限额重置,可自行选择使用时机。你可以在网页版或 Claude Desktop 的 Settings > Usage 下找到它,而不是在终端里的 Claude Code 中。重置会应用于你的整个账户,包括 Claude Code。

对于使用 API 密钥的情况,缓存读取降价对 Claude Code 影响最大。长时间智能体会话的大部分输入都花在缓存读取上。在下面图 B 计价的会话中,缓存这一项从 $1.00 降至 $0.40,是账单上降幅最大的一项。
你能节省多少取决于你工作的形态。以缓存读取为主的会话最多可节省 60% 的输入成本。没有缓存、答案很长的简短提问最多可节省 20%,因为输出占主导。大多数 Claude Code 任务介于两者之间。下面的计算器可以显示你的任务处于什么位置。
你可能看到过 Opus 5.5 的运行成本比 Opus 5 低 40%。这是我们对按 token 计费、使用默认设置的典型工作负载的估算。它假设 Opus 5.5 在其默认的 medium 档位下每个任务使用的 token 更少,再加上更低的价格,所以这并不是 token 价格降低了 40%。token 价格就是图 A 中的那些,图 B 显示了价格变化本身带来的影响。
Opus 5.5 在回答时可能使用更多 token,因为它在回复前总会先思考。我们预计人们用 Opus 5.5 能完成更多工作,但这因任务而异,所以请在你自己的工作上衡量。图 C 比较了两个模型每个任务的成本。这部分对工作的依赖远大于对价格的依赖。
在范围明确的任务上,两个模型完成的轮数大致相同,你得到的就是价格下降带来的好处。差距应该在开放式任务上最大,因为模型可能把很多轮花在错误的想法上。没有哪个单一数字适用于所有代码库,所以要实际衡量(见最后一节)。
长时间运行会以一份报告结束。 Opus 5.5 在长时间运行结束时,会说明它改动了什么、发现了什么,以及需要你提供什么。这也能省钱,因为当你能看到发生了什么时,你重新运行会话的频率就会降低。
相同任务并排对比
图 B 以相同的 token 数量为两个模型的一次会话定价。因此差异仅来自价格变化,别无其他。切换模型即可对比。token 数量仅为示意。
$3.50按 Opus 5 API 标价
- 缓存读取 2.0M$1.00
- 全新输入 200K$1.00
- 输出 60K$1.50
- 总计,Opus 5$3.50
这张账单包含 /usage 为一次会话显示的三行。按 token 计,缓存读取是最大的一行,为 2M。输出按 token 计最小,但按成本计最大。全新输入介于两者之间。它涵盖每个文件的首次读取以及每个新的工具结果。
图 B 为两个模型设定相同的 token 数量,因此它仅显示价格变化。你自己的会话在 Opus 5.5 上可能使用更多或更少的 token。按此定价,该会话成本约降低 31%。
一次有记录的运行还会叠加第二个效应,即模型工作量多少的变化。在出现一次错误开端的任务上,差距应该会拉大。
试试你自己的数字
设定你某个任务的用量,或从预设开始。这些预设相当示意性,但我仍建议你自己算一算。缓存输入按缓存读取价格计费,全新输入按输入价格计费,因此缓存滑块显示差距中有多少来自缓存读取。
要用真实会话填充滑块,请在任务结束时运行 /usage。Session 块会给出输入、输出和缓存数据。最后一个滑块是你对 Opus 5.5 在你的任务上少做多少工作的假设。若只看价格变化,将其保留为 0%。要根据你自己的工作情况设定它,方法如下:在 Opus 5 和 Opus 5.5 上运行同一任务,并比较轮次和输出 token。Measure it yourself 会逐步说明,Reading a session 则展示在 /usage 中应检查什么。
2.2M
所有轮次中发送给模型的内容,无论是否缓存。
91%
60K
包含思考,思考按输出计费。
10
0%
若只看价格,保留为 0%。Opus 5.5 可能比 Opus 5 使用更多或更少的 token,因此请在你自己的任务上测量。
Opus 5,这些 token$3.50每月 $770
Opus 5.5,这些 token$2.40每月 $528
按 API 标价的变化−31%仅因价格,每月少 $242
Opus 5,这些 token:$3.50。Opus 5.5,这些 token:$2.40。按 API 标价的变化:−31%,仅因价格,每月少 $242。
最大化会话价值的技巧
Opus 5.5 更低的价格让每个 token 成本更低。你如何运行会话决定了你使用多少 token,以下步骤会有所帮助。
在更换模型之前先提高 effort
Effort 为模型每轮消耗多少 token 设定了一个总体倾向:包括它的思考、它写出的文本以及它的工具调用。在较低的 effort 下,它进行的工具调用更少,且调用更简短。Opus 5.5 有四个级别(low、medium、high 和 xhigh),外加用于单次会话的 max。在下方选择一个级别,查看何时使用它以及设置它的命令。
Medium:适用于范围明确的日常工作
范围明确的日常工作。它每轮的思考量少于 high,因此每轮成本更低。
当任务范围明确时,从这里开始。
/effort medium/effort status/model/usage
Claude Code 会为每个模型设置一个默认级别,/effort status 会显示你的级别。对于范围明确的日常工作,试试 medium。当 medium 卡住时,试试 high。它每轮的开销高于 medium,但低于换用更大的模型。对于机械性工作,比如重命名或在多个文件中应用已知模式,使用 low。
在 Opus 5.5 上,默认是 medium,比 Opus 5 的默认级别 high 低一级。级别并不意味着在每个模型上代表相同数量的思考。在给定级别下,Opus 5.5 每轮的思考量都多于 Opus 5,在 xhigh 和 max 时尤为明显。所以不要沿用你为 Opus 5 选择的级别。从 medium 开始,把 xhigh 和 max 留给那些你已测量到收益的工作。
一个粗略理解 effort 定价的方式:假设 high 在一个任务中增加 20K 思考 token。在 Opus 5.5 上那是 $0.40。一个十轮的重试循环,使用 100K 缓存上下文,总共 10K 输出 token,成本大致相同。所以 high 在一个能省下一次重试的任务上就值回成本。而在一个 medium 本可以一次完成的任务上,它就是浪费。
当 medium 只修复了一层时
你需要更高 effort 的最明显迹象是:修复只停留在一层。
假设一个字段在 API handler 中被重命名。在 medium 下,模型更新了 handler,handler 的测试通过了,而客户端仍然发送旧字段。它做了被要求做的事。它只是没有读得足够远,去找到第二个调用方。在 high 下,它会在写入前花更多轮阅读调用点,并在一次处理中修改两层。
一项检查也能捕获同样的 bug。如果模型能运行一个经过客户端的测试,那么在 medium 下,旧字段在写入的那一轮就会让该测试失败。所以在提高 effort 之前,先检查模型是否有办法检查自己的工作。运行一次测试花费一轮及其输出。更高的 effort 会给每一轮都增加思考。
如果升级 effort 级别和增加检查都不起作用,那就换用更大的模型。
在会话中途更改 effort
在 Claude Code 中,运行 /effort 并带上一个级别,例如 /effort high。/effort status 会打印当前级别。你可以在任务中途更改它,新级别会应用于下一个请求。
在 Opus 5.5 上,使用 API key 或 Claude 订阅时,更改 effort 会保留缓存。你可以为一个困难步骤提高它,然后再降低,而无需重写对话。在 Amazon Bedrock、Google Cloud 的 Agent Platform 或 Claude apps gateway 上,更改 effort 仍会清除缓存的对话,下一个请求要为全部内容支付缓存写入费用。Opus 5.5 的思考始终开启,因此没有可更改的思考设置。
为你的工作选择合适的模型
模型选择决定了会话中每个 token 的价格,因此它对账单的影响比 effort 更大。它的影响范围也更广。每个继承主模型的子代理也会继承它的价格。大多数日子需要三种模型:一个用于查找的小模型,一个用于你密切监督的工作的 Opus 5.5,以及一个用于最难任务的更大模型。

Opus 5.5 作为日常主力
用 Opus 5.5 处理你监督的工作:跨几个文件的功能开发、调试,以及带有后续修改的代码审查。你阅读它的输出,并在它跑偏时介入,这样循环就能保持简短。
升级到 Fable 5.1
当结果比 token 价格更重要时,升级到 Fable 5.1。例如你不会监督的长时间运行、代码库中没有现成模式的问题,以及需要协调许多子代理的大型改动。不要等到第三次失败。如果 Opus 5.5 在 xhigh 下两次遇到同一个问题,就切换,问题解决后再切回来。对于交互式工作,Opus 5.5 更合适,因为它延迟更低、成本更少。
Fable 5.1 的标价是每百万输入 token 10 美元、每百万输出 token 50 美元,是 Opus 5.5 价格的 2.5 倍。它的缓存读取费用为每百万 0.25 美元,仅为 Opus 5.5 费率的 1.25 倍,因为其计费为输入价格的 0.025 倍。因此,差距在长时间、缓存密集的运行中最小,而在写入量大的任务中最大。
在自然的断点处切换。缓存属于前一个模型,所以预期在新模型上的第一轮要为整个对话支付写入价格。先运行 /compact,或者用一个简短的书面计划开启新会话,让那一轮更小。运行 /model 并带上别名或模型名称来切换。/model 还会把你的选择保存为新会话的默认值,所以困难部分完成后就切回来。
为查找而降级
为查找降级到 Sonnet 或 Haiku,而不是为写代码:负责搜索和总结的子代理、读取日志和测试输出,以及“这个定义在哪里”的问题。对于跨多个文件的机械式编辑,保留 Opus 5.5 并将 effort 设为 low。编辑仍由编写你其余代码的模型完成,每轮成本更低。
要把子代理放到更小的模型上,在其定义中设置 model: haiku 或 model: sonnet。要把每个子代理都放到同一个模型上,设置 CLAUDE_CODE_SUBAGENT_MODEL 环境变量。子代理定义中指定的模型会覆盖该变量。没有模型设置的子代理会运行在你的主模型上,除非设置了该变量。
每个子代理都在自己的上下文窗口中运行,并返回一份摘要,因此它读取的文件不会进入你的主对话。它仍然要为自己的 token 付费,所以模型设置决定了这笔开销的多少。
Agent teams 是一项实验性功能,会放大这一点。每个队友都是一个独立的 Claude Code 实例,拥有自己的上下文窗口,并且会一直消耗 token 直到退出。我们的成本文档指出,当队友以 plan 模式运行时,一个团队大约是一个标准会话 token 量的七倍。保持团队规模小,让每个任务自包含,并在队友的部分完成后将其关闭。
权衡在于:一个小模型如果误读搜索结果,会让主模型去找错误的文件,而主模型要为这段绕路付出代价。让小模型做那些错误容易被发现的工作,比如查找文件、运行测试和读取日志。
把判断权留给主模型。opusplan 别名以另一种方式拆分工作:Opus 在 plan 模式下制定计划,Sonnet 执行计划。这会把代码编辑交给 Sonnet,与上面的建议正好相反。在将其设为默认之前,先在你自己的任务上衡量一下。
迁移时检查你的提示词
为旧模型编写的指令会让 Opus 5.5 写更多内容并重复调用工具。在 Claude Code 中运行 /claude-api prompt-audit,检查你的 Claude Code 设置(例如你的 skills 和 CLAUDE.md 文件)中是否存在这些提示词反模式。它还会检查你在 Claude Platform 上构建的应用的代码。
我们在一次从 Opus 4.8 到 Opus 5.5 的迁移中测试了这一点,使用了一个包含 44 个工单的内部客户支持基准,其提示词中存在若干此类模式。迁移到 Opus 5.5 并在低 effort 下运行,使该基准的成本降低了约 18%。运行 prompt-audit 又进一步降低了 9%,最终比 Opus 4.8 的起点低约 25%。该审计移除了那些让模型写更多内容并重复调用工具的仪式性指令:一个强制性的六步流程、一条草稿纸规则、一条验证两次规则,以及相互矛盾的指令。
该结果来自一个基准,因此请将其视为示例,而非可预期的数字。运行审计,然后在真实任务上比较运行前后的 /usage(参见自行衡量)。
缓存与压缩
Claude Code 会为你处理缓存和压缩。你如何运行会话决定了它们能节省多少。
缓存如何工作
Claude Code 会缓存请求中重复的部分,例如系统提示词、工具定义以及到目前为止的对话。
在 Opus 5.5 上,一次缓存读取的成本是全新输入 token 的 5%。写入缓存的成本高于全新读取,按当前定价,五分钟缓存为输入价格的 1.25 倍,一小时缓存为输入价格的两倍。每次命中都会免费重置生命周期。
在 Claude Code 中,生命周期取决于你的付费方式。使用 Claude 订阅时为一小时。使用 API key 或云服务商时默认五分钟,而订阅在开始消耗用量额度后会降至五分钟。
在 120K token 的上下文下,Opus 5.5 上五分钟写入的成本约为 $0.60,读取约为 $0.02。一次写入的成本相当于 25 次读取。使用 API key 时,一次六分钟的咖啡休息会把下一次 $0.02 的读取变成 $0.60 的写入。同样大小的一小时写入成本约为 $0.96,在 API 上你可以支付这一溢价来覆盖一天中的空档。
会话形态与命中率
缓存存储的是前缀,因此它只能复用请求中从开头起与上一次匹配的部分。
稳定的会话会在每一轮向对话末尾追加内容,并保持较高的命中率。任何改变请求较早部分的操作都会降低命中率。更改工具定义会清空整个缓存,而更改系统提示词会从该点起清空缓存,这几乎就是全部内容。
在实践中,以下情况预计会发生缓存写入:
- 你暂停的时间超过缓存生命周期;
- 你在 Amazon Bedrock、Google Cloud 的 Agent Platform 或网关上更改 effort,因为该级别是缓存匹配内容的一部分;
- 你在一次对话中首次开启 fast 模式,这会改变缓存匹配的部分内容;
- 你连接或断开 MCP 服务器,这可能改变每次请求开始时加载的内容;
- 你切换模型,因为新模型从空缓存开始;以及
- 对话被压缩,这会重写缓存所匹配的历史记录。
所以在会话开始时设置好这些,然后在它工作期间不要改动它们。
为什么长会话每轮成本更高
每一轮都会重新发送整个上下文,因此随着上下文增长,每轮的成本也会增加,即使缓存是热的。在 20K token 的上下文下,一轮的缓存读取在 Opus 5.5 上花费约 $0.004。在 150K 时花费约 $0.03,而在该规模下 30 轮仅读取就花费 $0.90。同样的 30 轮在 20K 下花费约 $0.12。在 Claude 4.6 及之后的模型上,更大的上下文窗口不会改变每 token 的价格,因此成本完全来自重新发送对话。
其中大部分上下文是早期工作遗留下来的:一小时前的堆栈跟踪、你已经处理完的文件、你已经修复的测试运行的输出。每一轮仍然会发送所有这些内容。
压缩、/compact 和 /clear
当会话接近其上下文限制时,Claude Code 会总结较早的历史记录,以便后续轮次发送更少的内容。运行 /autocompact 并带上一个 token 数,可以更改在触发压缩之前上下文达到多满。
有两个命令可以让你自己来做这件事。/clear 会清空对话且不产生费用,所以当你转向无关工作时使用它。/compact 保持连续性,并产生一次请求的费用。它会读取它所总结的对话,你可以说明要保留什么,例如 /compact keep the failing test names and the schema change。
在 150K token 时进行压缩的大致价格约为 $0.25。这包括读取、几千个输出 token 的摘要,以及在更短上下文上的一次新的缓存写入。之后每一轮在读取上节省约 $0.025,因此压缩大约在十轮内就能收回成本。在你即将完成之前进行压缩,花费会超过它节省的。
这个价格假设缓存是热的。当缓存是热的时,摘要请求会从缓存中读取对话,所以在休息之前压缩,而不是在休息之后。在超过缓存生命周期的休息之后,同样的 /compact 会再次读取整个对话并将其写回缓存。在 150K token、五分钟缓存的情况下,仅输入就约为 $0.75。如果你已经走上了一条想放弃的路径,请改用 /rewind 回到较早的一轮。当缓存是热的时,这会返回到一个已经被缓存的前缀。
摘要也会丢失细节。在调试会话中途进行压缩可能会丢掉那行关键的日志。在自然的停顿处进行压缩,并且当下一步依赖于某些具体内容时,在 /compact 指令中说明。
在你输入之前加载的内容
你的 CLAUDE.md 文件 会在每个会话开始时加载到上下文中,因此其中的每一行都是每一轮重新发送内容的一部分。成本文档 建议将其保持在 200 行以内。MCP 工具定义是延迟加载的。开始时只加载工具名称和服务器指令,当使用某个工具时才加载其完整定义。运行 /mcp 查看哪些服务器已连接,并关闭你不使用的那些。
账单的其余部分
下表列出了影响 Claude Code 会话的其他计费规则,并在有文档的地方附上了链接。
快速模式让 Opus 5.5 的运行速度最高提升 2.5 倍,价格为标准价格的两倍:每百万输入 token $8,每百万输出 token $40。在 Claude 订阅上,它从使用额度中计费,而不是你的套餐限额。开启它后的第一个请求会按快速模式的输入价格对整段对话计费,且不使用缓存。因此请在会话开始时开启它,而不是在会话进行到深处时。
| 账单计算的内容 | 工作原理 |
|---|---|
| 缓存生命周期 | 在 Claude Code 中,订阅用户为一小时;使用 API 密钥或云提供商时为五分钟,或者当订阅开始消耗使用额度时。每次命中都会重置生命周期。API 以更高的写入价格提供一小时缓存。成本文档(Claude Code 生命周期)和提示缓存文档 |
| 缓存写入 | 按当前 API 定价,五分钟缓存为输入价格的 1.25 倍,一小时缓存为 2 倍。定价文档 |
| 思考 | 按输出 token 计费,包括未返回给你的思考内容。扩展思考文档 |
| 努力程度 | 适用于每个输出 token:文本、工具调用和思考。努力程度文档 |
| 自动压缩 | 在上下文窗口接近其限制时运行。使用带 token 数量的 /autocompact 设置阈值。上下文窗口文档 |
| 子代理和代理团队 | 子代理在自己的上下文窗口中工作并返回摘要。计划模式下的代理团队使用的 token 量约为标准会话的 7 倍。上下文窗口和成本文档 |
| 批处理 API | 通过 Message Batches API 发送的请求,输入和输出 token 半价。批处理文档 |
| 当前典型支出 | 平均值:在企业部署中,每位开发者每个活跃日约 13 美元。对于 90% 的用户,成本保持在每个活跃日 30 美元以下。这两个数字均针对当前模型。公开文档,成本页面(企业平均值和 90% 上限) |
自行测量
本文中的数字仅为示例。你的代码库、提示和习惯各不相同,因此请在你自己的任务上测量成本。以下是检查方法。
- 在会话中,运行 /usage。/cost 的作用相同。Session 块显示 token 使用量和按标价估算的美元成本。提示缓存行显示有多少输入来自缓存。在 Pro、Max、Team 或 Enterprise 计划中,同一屏幕会显示你的计划使用量条。美元数字是在你的机器上按标价计算的,因此在订阅计划中,它只是你做了多少工作的参考,而不是账单。
- 将同一任务运行两次。Opus 5.5 需要 Claude Code v2.1.280 或更高版本,因此请先运行
claude update。从你的待办事项中选一个,而不是玩具示例。使用 /model 在 Opus 5 和 Opus 5.5 之间切换。记录每次运行的轮次、输出 token 和成本。在得出结论之前,先做三到四个任务。 - 对于团队,使用使用量和成本报告。Claude Code Analytics API 提供每位用户的估算成本。Usage and Cost API 按模型以及缓存与未缓存 token 细分支出。
- 尝试努力程度阶梯。将一个困难任务分别在 medium 和 high 下运行。将一个机械性任务在 low 下运行。
解读会话
在任务结束时,在 /usage 中检查三件事。
- 缓存占比。对于长会话,它应该很高。如果很低,请查找长时间暂停、模型切换、中途连接的 MCP 服务器,或者在云提供商或网关上,努力程度的变化。提示缓存行通常会指出最近一次未命中的可能原因。
- 输出与输入之比。小改动却产生大量输出,通常意味着努力程度对该任务来说过高,或者模型正在重试。
- 总输入与对话规模之比。如果总输入是对话规模的许多倍,说明会话经历了许多轮次,值得阅读对话以找出循环重复的位置。
作为基准,Claude Code 的成本文档给出的企业部署平均值约为每位开发者每个活跃日 13 美元,而 90% 的用户每个活跃日低于 30 美元。如果某次会话的成本远高于你自己的正常水平,那就值得回顾一下。
请记住
- 对于范围明确的日常工作,使用中等投入。
- 给模型一种检查其工作的方法,并在计划模式下开始跨文件的更改。
- 当中等投入停滞时,将投入提高到高。使用 API 密钥或订阅时,这一更改会保留你的缓存。在云服务提供商或网关上,请在休息时更改。
- 如果 xhigh 两次遇到同一问题,请切换到 Fable 5.1。问题解决后再切换回来。
- 将搜索和读取日志的子代理放在 Sonnet 或 Haiku 上。将代码编辑保留在 Opus 5.5 上。
- 让长时间会话持续进行,以保持其缓存处于热状态。
- 在不相关的任务之间使用 /clear,并在休息时使用 /compact,同时注明要保留的内容。
- 最重要的一点:在每个模型上运行一个真实任务,并比较 /usage 报告的内容。你自己的数据才是值得信赖的。
希望这篇文章对你有帮助。如果你在 Opus 5.5 上的限制并不比在 Opus 5 上更宽松,请通过 /feedback 告诉我们。
延伸阅读:有效管理成本 · 模型配置 · 在 Claude Code 中选择 Claude 模型和投入级别 · 投入 · 提示缓存 · 最大化你的 Claude Code 会话价值
感谢 Michael Segner、Kacie Jenkins 和 Molly Vorwerck 的审阅。
来源:Claude.dev 开发者博客 · claude.dev