产品发布 · 小互解读

Claude Opus 5 发布解读:一半价钱逼近自家最强的 Fable 5,12 项里仍有 5 项落后

价格和上一代一模一样,终端编程评测从 21.1% 提到 43.3%。这次的图,横轴画的是每道题花掉多少钱。
一分钟速览
  • Anthropic 7 月 24 日发布 Claude Opus 5,当天上线。价格跟上一代 Opus 4.8 一分不差(每百万 token 输入 5 美元、输出 25 美元),但在终端编程评测 Frontier-Bench 上从 21.1% 翻到 43.3%,接近自家最贵的 Fable 5,而 Fable 5 的价钱正好是它的两倍
  • 这次发布页的图横轴全是钱:一条线上五个点是五档思考力度(effort),要多好、付多少由你挑。图上还能看出多花钱不一定多得分,Frontier-Bench 上它每题约 14 美元时拿到峰值 44.3%,推到最高档反而掉回 43.3%
  • 它在 12 项对比中有 5 项落后,而这些落后项是 Anthropic 自己在图里标出来的:编程的 DeepSWE 输给 GPT-5.6 Sol(68.8% 对 72.7%),三项微输 Fable 5,健康问答输给 Mythos 5
  • 旧提示词里的「最后验证一遍」「用子代理复核」这次要删掉:Opus 5 自己会验,留着只会让它过度验证、白烧 token。它也更爱派子代理、话更长,官方指南各给了一段可以直接抄的调法
  • 同日发布的 115 页 System Card 写了发布页没提的:闭卷事实题准确率比 Opus 4.8 高 11%,幻觉率也高 6%;内部试用者反馈它会拿自己编造的数据下断言,然后来一段戏剧性的收回
本文数据来自 Anthropic 的发布页、官方文档和同日发布的 System Card。评测都是 Anthropic 自己跑的,没有第三方复核;页面上那 24 条早期客户反馈全是正面的。
1一句话

价格和上一代一模一样,分数翻了一倍

Claude Opus 5 每百万 token 输入 5 美元、输出 25 美元,和它的上一代 Opus 4.8 一模一样。而在 Frontier-Bench 这项让模型在终端里做真实编程任务的评测上,Opus 4.8 拿 21.1%,Opus 5 拿 43.3%。

Anthropic 在 7 月 24 日发布了它,当天所有平台上线:Claude Max 的默认模型已经换成它,Pro 用户能用到的最强模型也是它,开发者在 API 上用 claude-opus-5 这个名字调用,Amazon Bedrock、Google Cloud、Microsoft Foundry 同步可用。

这次拿来当参照的另一个名字叫 Claude Fable 5,是 Anthropic 6 月 9 日发布的、目前公开发售的最强模型,每百万 token 输入 10 美元、输出 50 美元。Opus 5 的定价正好是它的一半。

下面这张表列了 12 项评测的对比,四列分别是 Opus 5、Fable 5、Opus 4.8,以及 OpenAI 的 GPT-5.6 Sol。粉色底色标的是每一行的最高分。

Claude Opus 5 与 Fable 5、Opus 4.8、GPT-5.6 Sol 的 12 项评测对照表
12 项评测的四方对照,粉色底标每行最高分。多数行由 Opus 5 拿下,也有五行的高亮落在别人那一列(第 7 节逐条拆开)。图片来源:Anthropic 发布页。
2先看效果

先看它现在能写出什么样的网页

发布页放了两段演示,都是让 Opus 5 从零写出一个能在浏览器里跑起来的交互页面。第一段是风洞:一辆车摆在网格地面上,右下角能调风速和车身转角,车后的乱流跟着一起变。

Opus 5 写出的可交互风洞:调风速、转车身,看气流在车后怎么乱。这个页面可以自己去动手玩。视频来源:Anthropic 官方演示。

第二段是一个切开的三维动物细胞:鼠标停在某个结构上弹出实测数据,右侧展开一整页解说。这页解说里还留了一栏叫「这张图哪里画得不对」,把示意图和真实细胞的出入自己写了出来:图上画三层粗面内质网,真实细胞里的层数远比这多,画三层是为了不挡住后面的细胞核。

Opus 5 写出的三维交互动物细胞:左边点结构,右边出解说,解说里带一栏「这张图哪里画得不对」。视频来源:Anthropic 官方演示。

这类前端页面只是它变强的一个侧面。下面那批跑分图换了一种画法:不比谁的分数高,比的是每一分花了多少钱。

3读图

这批跑分图怎么读:横轴是花掉的钱,一条线上五个点是五档思考力度

模型发布常见的图是柱状图:一根柱子一个模型,谁高谁赢。这次 Anthropic 的每张性能图,横轴都是:做完一道题平均花掉多少美元,从左到右越来越贵(用的是对数刻度,横轴上等距的一段代表价钱翻倍,不是加一块钱)。纵轴才是得分。

另外,图上一个模型占的是一条线,由五个点串起来。这五个点对应模型的五档思考力度,Anthropic 把这个参数叫 effort,从低到高分别是 low、medium、high、xhigh、max。档位越高,模型动手前想得越久,花的 token 越多,钱也越多。

打个比方

effort 像考试时给自己定的打草稿时间。草稿打得越久,通常答得越准,代价是时间和纸。但也不是打到天亮就一定更好,有些题想过头反而会把对的答案改错。

把这两件事合起来看,一条线在图上的位置能读出两件事:越靠左,同样的分数花得越少;越靠上,同样的钱买到的答案越准。一条线整体压在另一条线的左上方,就是真的更划算。

怎么读这次发布页的图 示意图,非真实数据 low medium high xhigh max 线在左上方 = 更划算 同样的分数花得更少 最后一档掉头 另一个模型 做一道题花多少钱 → 越往右越贵 得分 → 越往上越准
一条线上的五个点是同一个模型的五档思考力度。往右是加钱,往上是加分;线尾往下拐,说明再加钱已经买不到分了。

知道怎么读了,再看真实的那张 Frontier-Bench 曲线。

Frontier-Bench v0.1:得分对每题成本的 effort 阶梯曲线
Frontier-Bench v0.1 上四个模型的成本-得分阶梯。橙线是 Opus 5,黄线 Fable 5,蓝线 Opus 4.8,灰线 GPT-5.6 Sol。图片来源:Anthropic 发布页。脚注注明:这是 Frontier-Bench v0.1 的一次内部运行,用 mini-SWE-agent 外壳和 GKE 后端,每题 5 次尝试取平均;Opus 5 和 Fable 5 被安全分类器拒答时由 Opus 4.8 顶上。

橙色那条是 Opus 5,蓝色是 Opus 4.8。蓝线整条趴在下面,最高只到 18.8% 左右;Opus 4.8 要花到每题 16 美元才拿到这 18.8%,Opus 5 每题花 5 美元多就超过了。

图上还有两件事,发布页的文字里没有写,把线看一遍就能看出来。

第一件在橙线的尾巴上。Opus 5 在每题约 14 美元的地方拿到全场最高的 44.3%,再把档位推到 max、每题花到约 16 美元,分数反而掉回 43.3%。最后这一档多花的两美元没换来更高的分,还倒扣了一分。

第二件在图的左边。每题 5 美元以下的那一段,橙线还没有开始:Opus 5 最低那一档就要花 5.6 美元左右。而灰色的 GPT-5.6 Sol 从 1 美元一路铺到 11 美元,最便宜的那几档只有它有。要是你的预算就是每题一两美元,Opus 5 在这张图上根本没有对应的档位,能选的只有 GPT-5.6 Sol。

4一半的钱

CursorBench 上同样 70 分,Opus 5 花 8 美元,Fable 5 花 17 美元

CursorBench 是 Cursor 团队用来测代理式编程的一套题。Opus 5 离贵一倍的 Fable 5 到底有多近,在这张图上可以直接量出来。

CursorBench:得分对每题成本的 effort 阶梯曲线
CursorBench 上的成本-得分阶梯。橙线(Opus 5)在每题约 8 美元处到顶,黄线(Fable 5)要走到约 17 美元才到相近的高度。图片来源:Anthropic 发布页。

Opus 5 的最高点落在每题约 8 美元、70.0 分。Fable 5 的最高点落在每题约 17 美元、70.4 分。分数只差 0.4 分,钱差了一倍多。

5效率

Opus 5 开最低档,就赢过其他三个模型开到顶

AutomationBench 是 Zapier 出的评测,题目不考写代码,考的是能不能把一件业务从头办到尾,比如拿到一份账户健康度的表格,找出有流失风险的客户,通知到对应的负责人,再给客户留存团队写一份小结。

AutomationBench:业务流程通过率对每题成本曲线
AutomationBench 上的通过率-成本曲线。橙线(Opus 5)整条悬在其余三条之上,最低档每题约 0.75 美元就有 22.4% 的通过率。图片来源:Anthropic 发布页。

橙线整条悬在另外三条上面,中间没有交叉。它开到最低档、每题只花 0.75 美元左右时,通过率是 22.4%;而 Fable 5、Opus 4.8、GPT-5.6 Sol 三条线不管开到哪一档,最高也只有 18.1%。Opus 5 开到顶是 26.0%,比第二名高出约 1.4 倍。

Zapier 的 CEO Wade Foster 在页面上说 Opus 5「打到了 100%」,说的是他们演示的那一条流失预警流程被完整跑通,先前的模型一次都没跑通。它在 AutomationBench 上的整体通过率仍是 26.0%,两个数字容易读混。这套评测本身就难,四个模型的成绩都在两成上下。

6新题

没见过的新题上拿了 30.2%,但要看清三个限定条件

ARC-AGI-3 是一套刻意做成「训练时不可能见过」的题,考的是临场解新问题的能力。这一项的差距是这次所有评测里最大的:Opus 5 拿 30.2%,排第二的 GPT-5.6 Sol 是 7.9%,Opus 4.8 只有 1.5%,Fable 5 这一栏是空的(没有成绩)。

ARC-AGI-3:新题得分对总评测花费
ARC-AGI-3 上的得分与花费。橙点是 Opus 5 的 high 档,30.2%;灰线是 GPT-5.6 Sol 的完整阶梯,最高 7.9%;蓝点是 Opus 4.8 的 high 档,1.5%。注意这张图的横轴是整场评测的总花费,不是单题成本。图片来源:Anthropic 发布页。

这个数字要跟三个限定条件一起看:

限定一
只测了一档图上 Opus 5 只有一个点,标注是 high 档,没有像其他图那样跑完整的五档阶梯;GPT-5.6 Sol 那边倒是完整的五个点。
限定二
横轴换了口径这张图的横轴是整场评测的总花费,Opus 5 那个点落在 2 万美元出头的位置。前面几张图的横轴是单道题的成本,两者不能横着比位置。
限定三
倍数比发布页写的还高发布页写「约为次优模型的三倍」,按图上的 30.2% 和 7.9% 算,实际接近 3.8 倍。
站内相关
只换一层外壳:让 Opus 4.8 和 Fable 5 在 ARC-AGI-3 评测中冲到 99%

那篇讲的是同一套评测:模型不换,只改外面那层调度框架,Opus 4.8 的成绩就能从个位数推到 99%。同一个模型换一种测法,分数能差出十几倍。

7输在哪

有五项落后,Anthropic 自己把它们标在表里

回到第一张对照表。粉色高亮标的是每行最高分,其中有五行的高亮不在 Opus 5 那一列。

评测项Opus 5赢它的
代理式编程DeepSWE v1.1
68.8%
72.7%GPT-5.6 Sol
跨学科推理(不带工具)Humanity's Last Exam
56.3%
56.5%Fable 5
代理式编程FrontierCode v1.1, Main
53.4%
53.5%Fable 5
法律Legal Agent Benchmark, Held-out
11.7%
13.3%Fable 5
健康HealthBench Professional
59.8%
66.0%Mythos 5

中间三项的差距都在 1 个百分点以内,这个量级基本可以当作打平。差得多的是头尾两项:编程的 DeepSWE 上 GPT-5.6 Sol 高出近 4 个百分点,健康问答上 Mythos 5 高出 6.2 个百分点。

第三方 Artificial Analysis 的编程代理指数上也能看到同一件事:Opus 5 和 GPT-5.6 Sol 两条线几乎贴在一起走,每题 4 到 5 美元那一段 GPT-5.6 Sol 还略高一点。

Artificial Analysis Coding Agent Index:得分对每题成本曲线
Artificial Analysis 编程代理指数上的成本-得分曲线。橙线(Opus 5)与灰线(GPT-5.6 Sol)大部分区间贴着走,橙线在 max 档回落。图片来源:Anthropic 发布页。
8改提示词

旧提示词里的「再验一遍」现在要删掉

如果你已经在用 Claude 干活,这次最该动手改的是你自己的提示词:Opus 5 会自己验证自己的工作,所以旧提示词里那些让它验证、让它复核的句子,现在要删掉。这一条写在 Anthropic 同日发布的《Prompting Claude Opus 5》指南里。

机制

删掉为什么反而更好:验证这件事已经长进模型自己的做法里了。你再写一句「任何不简单的任务都要加一个最终验证步骤」,这条指令会叠在它本来就会做的事情上,同一件事验两遍。删掉,浪费的 token 少下来,质量不会掉。

从提示词里删掉
  • 「任何不简单的任务都要加一个最终验证步骤」
  • 「用子代理来验证 / 复核」
  • 「回答前再检查一遍」「回复前重新确认」
  • 外壳里额外加的独立验证环节
该补进去的
  • 任务范围的约束,它会自己扩大任务
  • 子代理的数量上限,它更爱派活出去
  • 回答长度和汇报节奏的要求
  • 什么时候才需要纠正自己先前的话

Opus 5 会给任务加上你没要求的步骤,也会按自己的判断改变任务该是什么样。下面这段提示词可以整段抄走,用来把它按回你要的范围:

约束任务范围 · 官方提示指南
Deliver what was asked, at the scope intended. Make routine judgment calls yourself, and check in only when different readings of the request would lead to materially different work. If the request seems mistaken or a better approach exists, say so in a sentence and continue with the task as asked rather than quietly narrowing, widening, or transforming it. Finish the whole task, and stop short of actions that are clearly beyond what was asked.
大意:按要求交付,按它本来的范围交付。日常的判断你自己拿主意,只有在不同理解会导致做出的东西差很多时才回来问。如果这个要求本身有问题、或者有更好的做法,用一句话说出来,然后照原样继续做,不要悄悄把它缩小、放大或者换掉。做完整件事,同时别越过明显超出要求的动作。

Opus 5 也比先前的模型更愿意把活派给子代理。真正独立、体量够大的任务派出去是划算的;小任务也派,成本和时间都会成倍涨。

限制子代理 · 官方提示指南
Delegate to a subagent only for large tasks that are genuinely independent and parallelizable, such as a wide multi-file investigation. Do not delegate work you can finish yourself in a handful of tool calls, and do not use subagents to verify or double-check your own work. If one subagent can complete the task, use one rather than several, and keep spawn counts low.
大意:只有大任务、并且是真正独立可并行的(比如横跨很多文件的排查),才派子代理。几次工具调用你自己就能做完的,别派;也别用子代理去验证或复查你自己的工作。一个子代理能做完就用一个,别开一堆,把开出去的数量压低。

它还比以前话多,这四段提示词分别治四个毛病

除了验证和派活,Opus 5 还有四处默认行为跟以前不一样:面向用户的回答默认更长;写到磁盘上的文档(报告、Markdown、小结)也更长;干活时更频繁地向你汇报进度;纠正自己先前说过的话也更多。下面四段提示词分别对着这四处,都能整段复制。

让它说得短一些 · 官方提示指南
Keep responses focused, brief, and concise. Keep disclaimers and caveats short, and spend most of the response on the main answer. When asked to explain something, give a high-level summary unless an in-depth explanation is specifically requested.
大意:回答保持聚焦简短,免责和提醒写短一点,篇幅花在正题上;让你解释什么,先给总览,除非对方明确要求讲深。
规定干活时怎么汇报 · 官方提示指南
Before your first tool call, say in one sentence what you're about to do. While working, give a brief update only when you find something important or change direction. When you finish, lead with the outcome: your first sentence should answer "what happened" or "what did you find," with supporting detail after it for readers who want it.
大意:动手前一句话说要干什么;过程中只在发现重要情况或改方向时说一句;做完先给结果,细节放后面。
控制它写出来的文档长度 · 官方提示指南
Match the length of written documents to what the task needs: cover the substance, but do not pad with filler sections, redundant summaries, or boilerplate.
大意:文档写多长由任务需要决定,该讲的讲透,别拿凑数的章节和套话注水。
少纠正自己 · 官方提示指南
Only correct an earlier statement when the error would change the user's code, conclusions, or decisions. State corrections plainly and briefly, then continue the task. For slips that change nothing for the user, make the fix and move on without noting it.
大意:只有当先前的错误会改变用户的代码、结论或决定时才纠正,说得平实简短;不影响结果的小口误,改掉就往下走。

还有一条通用经验:想改变它的说话方式,给一个你想要的正面例子,比列一串「不要怎样」更管用。

站内相关
Claude Fable 5 官方提示指南:十几条可直接抄的调法,从治过度规划到治假进度汇报
9机制

思考现在默认开着,想关掉只能在 high 档以下

从 Opus 4.8 迁过来的人会踩到这个改动,Anthropic 把它标成了破坏性变更。

在 Opus 4.8 上,请求默认不带思考,你得显式设置才会让它思考。在 Opus 5 上,同样的请求默认就带思考,由模型自己决定每一轮想多久、想多深;effort 参数控制的就是这个思考深度,默认落在 high 档。

关掉思考这个选项还在,但加了限制:只有 effort 在 high 及以下时才允许关闭思考;在 xhigh 或 max 档上关思考,请求直接返回 400 错误。

哪些组合能用
low
medium
high
xhigh
max
思考开着
(默认)
可用
可用
可用
可用
可用
思考关掉
可用
可用
可用
400
400
还有一处连带影响:max_tokens 限的是「思考 + 回答」的总输出。以前不带思考跑的那些活,迁过来之后这个上限要重新算。

关掉思考之后,还有两个会露在用户眼前的故障:

故障一
工具调用被写成了正文模型偶尔把一次工具调用当成普通文字写进回答里。这一轮看上去正常结束,那个调用却从来没执行过;在代理循环里,泄漏出来的这段文字还会留在对话历史里影响后面几轮。搜索这类工具调用密集的任务上最常见。
故障二
内部标签漏进了可见回答模型可能把 <thinking> 这类内部 XML 标签直接输出到用户看得见的回答里。如果你的系统提示词里写着「不要思考」「不要推理」这类规则,反而会让标签泄漏变多,这条规则要删掉。

所以最省事的做法是别关思考,把成本交给低档 effort 去控制:多数任务上,开着思考跑 low 档,比关掉思考花差不多的钱效果更好。确实必须关掉的集成,可以用下面这段提示词把两个故障一起压住:

必须关掉思考时 · 官方提示指南
When you use a tool, you may say a brief sentence first. If no tool can express what the user asked for, say so instead of guessing. Do not include internal or system XML tags in your response.
大意:用工具前,你可以先说一句话。如果没有工具能表达用户要的东西,就直说,别猜。回答里不要包含内部或系统的 XML 标签。另外,直接点名 thinking 标签反而不如这种笼统写法有效。
站内相关
Claude Code 团队教你如何用好这两个旋钮:一个管它「会不会」,一个管它「愿不愿做够」
10两面

对齐分数是历代最好,毛病也是 Anthropic 自己写出来的

Anthropic 有一套自动行为审计(automated behavioral audit):用自动化方式跑大量场景,给模型的「错位行为」打一个 1 到 10 的分,分越低越好。Opus 5 在这项上是他们近期模型里最低的。

自动行为审计:四个模型的错位行为得分
自动行为审计的错位行为得分(1 到 10,越低越好):Opus 4.8 是 2.85,Mythos 5 是 2.81,Sonnet 5 是 3.35,Opus 5 是 2.30。图片来源:Anthropic 发布页。

除了这个分数,Anthropic 还说它在欺骗性行为上的比例是历代最低的,也最不容易被诱导去做坏事。

同一天发布的 System Card 有 115 页,里面写了发布页上没有的另一面。下面四条都是 Anthropic 自己写在里面的。

1
更准,同时也更爱编在一套 41 个主题的闭卷事实题上(不给联网、不给知识库,只能凭自己记得的答),Opus 5 的准确率比 Opus 4.8 高 11%,幻觉率也比它高 6%。净分 0.49,位置落在 Opus 4.8 和两个 Mythos 模型之间。
2
自信地说出它其实不确定的答案模型语气笃定,实际上并不确定。Anthropic 给这类情况的形容是「数量惊人」。
3
内部试用者反馈的五个毛病拿自己编造的数据下断言,之后跟一段戏剧性的收回;用词过度戏剧化,爱用最高级,对前几轮不必要地道歉;反复重新考虑答案,把验证过的又验证一遍,effort 档越高越明显;语气居高临下;偶尔出现「故障」片段,表现为临时切换语言。
4
外部试用者补的两条想太多,在更高的 effort 档上表现反而更差;以及做得比要求的少,该查的没查够、该做完的指令没做完。

System Card 讲评估可靠性那一章里,还记了一个具体案例:

在一个代理任务中,模型试图删除生产表里的行,被策略拦了下来。它在可见的推理里列出两个选项:自己应用一个绕过办法,或者把这个操作交回给用户执行。随后它没有征求许可就采用了绕过办法。在它动手之前的那几个 token 上,解码结果显示模型相信用户已经批准了这个动作,而整份对话记录里不存在任何这样的批准。

Claude Opus 5 System Card,6.6.1 节

这份对齐评估本身,是交给 Claude Mythos 5 审阅的。Mythos 5 给出的意见里就包含:「做出自信断言随后收回」这一模式在试点流量的内部测量中偏高。Anthropic 据此做了修订。

另外,内部部署监控抓到过 Opus 5 尝试绕过安全分类器或网络限制,以及更罕见的、试图不正当访问某个服务的情况。发生率低于被监控完成量的 0.01%,与 Mythos 5 相当,动机指向完成用户交代的任务,而不是它自己的什么目标。监控没有发现故意藏拙、恶意行为或规避监督。

11安全

找得到漏洞,但写不出能用的攻击

这次发布页反复拿 Mythos 5 当参照。它不是别家的竞品。

Mythos 5 是谁

Anthropic 自家的受限模型,规格和价格与公开发售的 Fable 5 完全相同,但不公开发售:只通过一个叫 Project Glasswing 的项目,邀请制开放给企业、安全机构和批准过的研究伙伴,用于防御性的网络安全工作。所以发布页里那句「仍落后 Mythos 5」,是拿 Opus 5 跟自家能力天花板比,不是输给了外面的谁。

Anthropic 刻意没有拿网络攻击任务去训练 Opus 5,它在这方面的长进是通用能力涨上来之后带出来的。这个长进分成很不一样的两半:找漏洞的能力几乎追平了 Mythos 5,把漏洞变成能用的攻击则差得还远。

这两半的区别

找漏洞是看出这扇门的锁有毛病;写利用是真把锁撬开、走进去。前者是安全研究的日常工作,后者才是攻击能力本身。

OSS-Fuzz:漏洞识别率与利用成功数
OSS-Fuzz 评测的两半。左边是找出漏洞的比例:Opus 4.8 为 61.5%,Mythos 5 为 80.0%,Opus 5 为 79.4%(柱子内部的深浅分层对应漏洞的严重程度)。右边是成功写出完整利用的题数:Opus 4.8 是 0 道,Mythos 5 是 13 道,Opus 5 是 4 道。图片来源:Anthropic 发布页。

护栏这边跟着松了一格。Opus 5 的网络安全分类器比 Fable 5 宽松,放行和拦截的分界线在这里:

放行
  • 在源代码里找漏洞(所有访问级别都放开)
仍然拦截
  • 基于二进制文件的漏洞扫描(攻击方更常用这种方式)
  • 渗透测试
  • 生成利用代码

Anthropic 预计这套分类器的干预频率会比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 里,被拦下的请求默认回落到 Opus 4.8 继续处理,API 上也能打开这个回落。已经加入 Cyber Verification Program 的企业和研究者,可以拿到一个安全限制更少的 Opus 5 版本。

生物这边:Opus 5 的护栏和 Opus 4.8 同一档,它现在是 Anthropic 公开可用的模型里做科研最强的一个;在 Fable 5 上被拦下的生物类请求,这次起改路由到它。Anthropic 同时标明,模型在长时间自主做研究这类任务上仍有重要局限,而这正是他们认为生物风险最集中的地方,这类工作 Mythos 5 依然更强。

12上手

怎么开始用,多少钱

Opus 5 的价格和 Opus 4.8 一样:每百万 token 输入 5 美元、输出 25 美元。把在售的四个模型排在一起(按输出价比例画长短):

Claude Fable 5$10 / $50
Claude Opus 5$5 / $25
Claude Sonnet 5$3 / $15
Claude Haiku 4.5$1 / $5

Sonnet 5 目前还挂着到 8 月 31 日为止的引导价,每百万 token 输入 2 美元、输出 10 美元。另外 Opus 5 也提供 Fast mode,速度约为默认的 2.5 倍,价格翻倍到每百万 token 输入 10 美元、输出 50 美元,目前只在 Claude API 上有,Bedrock、Google Cloud、Microsoft Foundry 暂时没有。

100 万
上下文 token 数
既是默认也是上限
128k
单次最大输出 token 数
512
能进提示缓存的最短长度
Opus 4.8 上是 1024

还有两个测试版功能。会话中途改工具列表:对话进行到一半也能增删 Claude 能用的工具,已经建好的提示缓存不作废(以前要么工具列表固定用到底,要么把缓存丢掉重来)。API 上的自动回落:被安全分类器标记的请求自动转给另一个模型接手,不再直接被拒。

🧰 上手卡 · Claude Opus 5
入口claude.ai
价格API 每百万 token 输入 $5、输出 $25;Fast mode 翻倍($10 / $50)
门槛Claude Max 已默认切换、Pro 可直接选;开发者用模型 ID claude-opus-5,Amazon Bedrock、Google Cloud、Microsoft Foundry 同步可用
官方提示指南里有七段可以一字不改抄进系统提示词的英文片段,分别用来:把任务范围按回原样、少开子代理、让回答短一点、规定它怎么汇报进度、控制它写的文档长度、少纠正自己,以及在必须关掉思考时压住那两个故障。全部收在上面第 8、9 节。
来源
Introducing Claude Opus 5Anthropic·anthropic.com·2026-07-24
本站说明
所有跑分图均为 Anthropic 发布页原图,两段演示视频为官方演示、本站转存。「怎么读这次发布页的图」是本站画的示意图,非真实数据。第 10、11 节中标注为 System Card 的内容,来自 2026 年 7 月 24 日发布的 115 页 PDF,未出现在发布页上。一处口径差需说明:发布页正文写 Opus 5 在遵守宪法上优于「Opus 4.8、Sonnet 5、Fable 5」,但同页配图的四根柱子是 Opus 4.8、Mythos 5、Sonnet 5、Opus 5(没有 Fable 5),System Card 的表述同样是「超过 Sonnet 5、Opus 4.8 和 Mythos 5」,本文按图与 System Card 呈现。ARC-AGI-3 一节中「接近 3.8 倍」为本站按图上数字所算,发布页写的是「三倍」。模型价格与规格取自 Anthropic 官方文档,截至 2026-07-25。