本页目录8
- Opus 5.5 对典型工作负载的运行成本比 Opus 5 低约 40%,长会话、高上下文场景省得最多
- 过去半年 Claude Code 单次 prompt 工作时长增至 3.3 倍、模型调用次数增加超 40%,中断减少 68%
- 单次请求上下文量增长约 2.6 倍,输入输出 token 比从 189:1 变为 324:1,缓存命中率提升明显(缓存未命中下降超 50%)
- 缓存读取 token 价格下调 60%,Opus 5.5 上缓存 token 成本约为部分竞品的五分之一
- Opus 5.5 完成同类任务所需轮次更少,输出速度比 Opus 5 快 30% 以上
- 建议在会话开始时就选定模型、离开前先 compact、长会话开启一小时缓存有效期,以保护缓存命中
本文是对官方文章「Claude Opus 5.5: Cost-Effective Coding Sessions」的中文要点摘要,完整内容以原文为准:https://claude.com/blog/claude-opus-5-5-built-for-coding-sessions-that-use-more-context
这篇文章(2026-09-24 发布)从 Claude Code 的实际使用数据出发,解释了 Claude Opus 5.5 为什么能让长时间、大上下文的编程会话变得更省钱。
核心结论
按 token 计费的典型工作负载下,Claude Opus 5.5 的运行成本比 Opus 5 降低约 40%。节省幅度在会话更长、上下文更重的场景中最为明显——这正是当前 Claude Code 用户的主流用法。
Claude Code 用户行为的变化(2026 年 3 月至 9 月)
官方对这半年的聚合数据做了对比,发现开发者的使用模式发生了明显转向:
- 每个 prompt 上,Claude 的工作时长变为原来的 3.3 倍,模型调用次数增加超过 40%
- 会话中的中断次数减少了 68%
- 单次请求携带的上下文量增长了约 2.6 倍
- 输入输出 token 比从 189:1 变为 324:1(意味着模型在给出结果前要处理和消化更多上下文)
- 开发者接入工具服务器/skill 的比例约翻倍,同时手动粘贴文本的量减少了三分之一左右
这组数据说明,Claude Code 正在从「频繁的短交互」演变为「更少但更长、更自主」的工作会话,背后依赖更多的工具调用和上下文积累。
Opus 5.5 为什么更省钱
缓存更便宜
官方直接下调了 Opus 5.5 的定价:
- 输入、输出 token 价格下调 20%
- 缓存读取(cached token reads)价格下调 60%——这对依赖大量上下文重复读取的 agentic 工作流影响最大
文章特别提到,在 Opus 5.5 上读取一个缓存 token 的成本,只相当于部分竞品的五分之一左右。
Claude Code 更擅长利用缓存
除了降价,Opus 5.5 在缓存命中率上也有实质提升:
- 缓存未命中(cache miss)的比例下降超过 50%
- 新增了一些机制,避免登录刷新、会话中途插入指令等操作意外打破已有缓存
- API 用户可以设置一小时缓存有效期
- 通过 fork 方式派生的 subagent 会继承父会话的缓存,不必从零重新构建上下文
同样的任务,更少的轮次
Opus 5.5 完成同一任务所需的对话轮次比此前版本更少,输出生成速度比 Opus 5 快 30% 以上;这种效率优势在开放式(open-ended)任务上体现得最明显。文章还提到,官方客户 Zeta Labs 的案例显示,使用 Opus 5.5 时成本降至约一半、完成的高难度任务数量约为 Opus 5 的两倍,但文章强调这只是单一客户的案例数据,效果因任务而异。
如何更好地保护缓存命中(官方建议)
为了在实际使用中拿到上述的成本优势,文章给出了几条可操作建议:
- 在会话开始时就选好模型,尽量避免中途切换模型(切换会打断缓存链)
- 离开前先执行 compact 操作,而不是等回来后再执行,把会话压缩后再暂停,减少之后恢复时的重新计算
- 长时间会话建议开启一小时缓存有效期,以覆盖开发者中途离开、思考、评审代码等间歇性操作
小结
这篇文章的核心信息是:随着 Claude Code 的使用方式从「短平快」转向「长会话、重上下文、多工具调用」,Opus 5.5 通过降价 + 提升缓存命中率 + 减少完成任务所需轮次三方面共同发力,让长会话场景下的实际使用成本明显低于上一代 Opus 5。对开发者而言,合理利用缓存机制(固定模型、及时 compact、设置合适的缓存有效期)是拿到这部分成本优势的关键。