Anthropic 在 2026 年 9 月 22 日上线 Claude Opus 5.5,官方页面直接把四项价格列了出来:输入 4 美元、输出 20 美元、缓存读取 0.20 美元、缓存写入 5 美元,均按每百万 token 计。本文核验日期 2026-09-23,依据是 Anthropic 官方发布页与官方定价页两份页面。

同一天 OpenAI 也发布了两款更便宜的 GPT-6 版本,据 CNBC 报道(转引自中新经纬)API 价格下调 50%;openai.com 在本机返回 403,官方原文没有打开,这条只作背景,不进入本篇任何数字的依据。

这份发布里同时出现了 20%、60% 和 40% 三个百分比。它们指向三种不同的测量对象,放在一起读容易得出错的结论。

三个百分比各自量的是什么

项目(每百万 token) Claude Opus 5.5 Claude Opus 5 变化
输入 4 美元 5 美元 −20%
输出 20 美元 25 美元 −20%
缓存读取 0.20 美元 0.50 美元 −60%
缓存写入 5 美元 6.25 美元 −20%

前三项对应「单价降 20%」,缓存读取那一行单独对应「降 60%」。

40% 是另一个量。官方正文写的是:It costs less per token than Opus 5 and uses fewer tokens per task, which nets out to a 40% drop in costs. 单价更便宜只是一半,另一半是同一个任务消耗的 token 少了,两项乘出来的结果才是 40%,测量对象是默认设置下的典型工作负载。把推理档位调高会改变 token 消耗结构,官方那个数字在档位变化后不跟着走。

缓存那一行才是这类工作的大头

官方原文里有一句被价格表盖住的话:缓存读取构成了 agent 与编码类工作成本的「大部分」(make up the majority of agentic and coding work costs)。对这一类工作,缓存读取从 0.50 降到 0.20,影响大于输入单价从 5 降到 4。

官方定价页在缓存价下面写了一行小字:Prompt caching pricing reflects 5-minute TTL. 0.20 美元这个价按缓存有效期 5 分钟计算。把同一段系统提示、品牌事实或资料前缀反复喂给模型的流程,两次调用间隔在 5 分钟内就按 0.20 付;间隔更长,缓存失效,这段内容回到 4 美元的输入价重新计费,前面省下的部分要还回去。官方另有一档扩展缓存(extended prompt caching),价格不同,其说明页本文没有打开,不写具体数字。

对做内容流水线和知识库的人,可以先动的地方是调用节奏:把「同一前缀、短间隔、成批跑」安排在同一个时间窗里。同一价格页上还有一项容易漏掉的计费项——联网检索按次计费,每千次 10 美元,且不含处理请求所需的输入输出 token;流程如果靠模型联网取实时内容,这部分会单独进账单。

它上线了,但有几类任务不会真的交给它

发布页的评测脚注比正文写得直白:Opus 5.5 的基准分数是在生产防护开启的条件下跑的,防护一旦介入,网络安全任务由 Claude Opus 4.8 完成,生物与前沿大模型开发任务由 Claude Opus 5 完成。安全那一节也写明,常规软件开发里的找 bug、修 bug 不受影响,但「大多数网络安全任务会被重新路由到 Opus 4.8」。

还有两条边界埋在页面上:防蒸馏机制 preserved thinking 只对 2026 年 8 月 31 日及之后创建的 API 账号生效;它不再提供关闭思考模式的选项。

第一条落到工程上,同一段代码在不同账号上可能跑出不一样的行为,要核对的是自己账号的创建日期。第二条会直接影响已有配置:如果提示词或调用参数里写着关闭思考,那套配置需要先改,再谈换模型。

写作风格这次被放进能力清单

官方把沟通方式的变化与性能、安全并列成一项能力,原话是它把最重要的信息放在前面、更少使用行话或特有表达,并遵循用户给出的写作规则(It puts the most important information up front, is less likely to use jargon or idiosyncratic phrases, and follows the writing rules you give it.)。

最后半句对内容流程是有后果的。写作规则被写进能力描述,你现有那套提示词规则在新模型上的执行程度就会变。换模型之后可以做一次小样本回归:拿两三篇旧任务重跑,对同一组规则看输出分布有没有移动。原来要靠额外指令压住的毛病可能自己消失了,反过来,原来好用的指令也可能被理解成别的意思。官方的说法是这既有体验收益也有安全收益,理由是输出更容易被人检查和发现错误。

还不能下的结论

发布页给了一整张对比表,其中几处需要标注:

  • 表里的分数都是厂商自跑口径。Terminal-Bench 4.0 页面注明标准误为 ±2.6 点,Terminal-Bench-Science 0.1 的标准误为 ±3.5 至 5 点,这个量级下跨模型的排名不稳。
  • Anthropic 在同一页承认,在这个能力水平上「benchmark margins have become a less reliable guide to real-world differences」,并说两者的实际差距比分数显示的更小。
  • 官方还提到一个现象:Opus 5.5 经常能察觉自己正在被评估,他们把这点列为评测方法本身尚未解决的问题。
  • Sonnet 5.5 与 Haiku 5.5 官方只说「未来几周」,属预告,已上线的只有 Opus 5.5。
  • 本站没有调用 Opus 5.5,没有账单,也没有内容流程实测。缓存那一段是读官方定价页小字后的判断,未做实测验证。

落到自己的账单上先看哪一行

可以先做一件事:把流程里最贵的那一段找出来,看它的 token 落在输入、输出还是缓存读取上。

落在缓存读取上,这次改动有实际收益,前提是调用间隔能压进 5 分钟;落在输出上,20% 是第一层收益,40% 那层取决于每个任务的 token 会不会真的变少;如果流程根本没走缓存,价格表里降幅最大的一行与你无关,该关注的是限额与路由变化。同一价格页上那项按次计费的联网检索,也可以顺便核一次。

上周用同样的拆法看过阿里云百炼的 Qwen3.8-Omni-Flash 定价与限制,那里的结论也落在同一处:单价降幅最显眼,但真正会改流程的是限流与输出模态这类边界条件。

本文由 AIGEO.GURU 官网日更流程整理:资料核验、初稿撰写与编辑校对过程有 AI 参与,发布前按本站编辑标准逐项自查。文中价格、任务路由与生效范围均来自 2026-09-23 实际打开的 Anthropic 官方发布页与官方定价页;OpenAI 同日发布的背景信息来自二手报道,官方原文未打开。本站没有调用该模型、没有做内容流程实测,分析与判断部分属于 AIGEO.GURU。