Claude Opus 5 发布解读:一半价钱逼近自家最强的 Fable 5,12 项里仍有 5 项落后
- Anthropic 7 月 24 日发布 Claude Opus 5,当天上线。价格跟上一代 Opus 4.8 一分不差(每百万 token 输入 5 美元、输出 25 美元),但在终端编程评测 Frontier-Bench 上从 21.1% 翻到 43.3%,接近自家最贵的 Fable 5,而 Fable 5 的价钱正好是它的两倍
- 这次发布页的图横轴全是钱:一条线上五个点是五档思考力度(effort),要多好、付多少由你挑。图上还能看出多花钱不一定多得分,Frontier-Bench 上它每题约 14 美元时拿到峰值 44.3%,推到最高档反而掉回 43.3%
- 它在 12 项对比中有 5 项落后,而这些落后项是 Anthropic 自己在图里标出来的:编程的 DeepSWE 输给 GPT-5.6 Sol(68.8% 对 72.7%),三项微输 Fable 5,健康问答输给 Mythos 5
- 旧提示词里的「最后验证一遍」「用子代理复核」这次要删掉:Opus 5 自己会验,留着只会让它过度验证、白烧 token。它也更爱派子代理、话更长,官方指南各给了一段可以直接抄的调法
- 同日发布的 115 页 System Card 写了发布页没提的:闭卷事实题准确率比 Opus 4.8 高 11%,幻觉率也高 6%;内部试用者反馈它会拿自己编造的数据下断言,然后来一段戏剧性的收回
价格和上一代一模一样,分数翻了一倍
Claude Opus 5 每百万 token 输入 5 美元、输出 25 美元,和它的上一代 Opus 4.8 一模一样。而在 Frontier-Bench 这项让模型在终端里做真实编程任务的评测上,Opus 4.8 拿 21.1%,Opus 5 拿 43.3%。
Anthropic 在 7 月 24 日发布了它,当天所有平台上线:Claude Max 的默认模型已经换成它,Pro 用户能用到的最强模型也是它,开发者在 API 上用 claude-opus-5 这个名字调用,Amazon Bedrock、Google Cloud、Microsoft Foundry 同步可用。
这次拿来当参照的另一个名字叫 Claude Fable 5,是 Anthropic 6 月 9 日发布的、目前公开发售的最强模型,每百万 token 输入 10 美元、输出 50 美元。Opus 5 的定价正好是它的一半。
下面这张表列了 12 项评测的对比,四列分别是 Opus 5、Fable 5、Opus 4.8,以及 OpenAI 的 GPT-5.6 Sol。粉色底色标的是每一行的最高分。
先看它现在能写出什么样的网页
发布页放了两段演示,都是让 Opus 5 从零写出一个能在浏览器里跑起来的交互页面。第一段是风洞:一辆车摆在网格地面上,右下角能调风速和车身转角,车后的乱流跟着一起变。
第二段是一个切开的三维动物细胞:鼠标停在某个结构上弹出实测数据,右侧展开一整页解说。这页解说里还留了一栏叫「这张图哪里画得不对」,把示意图和真实细胞的出入自己写了出来:图上画三层粗面内质网,真实细胞里的层数远比这多,画三层是为了不挡住后面的细胞核。
这类前端页面只是它变强的一个侧面。下面那批跑分图换了一种画法:不比谁的分数高,比的是每一分花了多少钱。
这批跑分图怎么读:横轴是花掉的钱,一条线上五个点是五档思考力度
模型发布常见的图是柱状图:一根柱子一个模型,谁高谁赢。这次 Anthropic 的每张性能图,横轴都是钱:做完一道题平均花掉多少美元,从左到右越来越贵(用的是对数刻度,横轴上等距的一段代表价钱翻倍,不是加一块钱)。纵轴才是得分。
另外,图上一个模型占的是一条线,由五个点串起来。这五个点对应模型的五档思考力度,Anthropic 把这个参数叫 effort,从低到高分别是 low、medium、high、xhigh、max。档位越高,模型动手前想得越久,花的 token 越多,钱也越多。
effort 像考试时给自己定的打草稿时间。草稿打得越久,通常答得越准,代价是时间和纸。但也不是打到天亮就一定更好,有些题想过头反而会把对的答案改错。
把这两件事合起来看,一条线在图上的位置能读出两件事:越靠左,同样的分数花得越少;越靠上,同样的钱买到的答案越准。一条线整体压在另一条线的左上方,就是真的更划算。
知道怎么读了,再看真实的那张 Frontier-Bench 曲线。
mini-SWE-agent 外壳和 GKE 后端,每题 5 次尝试取平均;Opus 5 和 Fable 5 被安全分类器拒答时由 Opus 4.8 顶上。橙色那条是 Opus 5,蓝色是 Opus 4.8。蓝线整条趴在下面,最高只到 18.8% 左右;Opus 4.8 要花到每题 16 美元才拿到这 18.8%,Opus 5 每题花 5 美元多就超过了。
图上还有两件事,发布页的文字里没有写,把线看一遍就能看出来。
第一件在橙线的尾巴上。Opus 5 在每题约 14 美元的地方拿到全场最高的 44.3%,再把档位推到 max、每题花到约 16 美元,分数反而掉回 43.3%。最后这一档多花的两美元没换来更高的分,还倒扣了一分。
第二件在图的左边。每题 5 美元以下的那一段,橙线还没有开始:Opus 5 最低那一档就要花 5.6 美元左右。而灰色的 GPT-5.6 Sol 从 1 美元一路铺到 11 美元,最便宜的那几档只有它有。要是你的预算就是每题一两美元,Opus 5 在这张图上根本没有对应的档位,能选的只有 GPT-5.6 Sol。
CursorBench 上同样 70 分,Opus 5 花 8 美元,Fable 5 花 17 美元
CursorBench 是 Cursor 团队用来测代理式编程的一套题。Opus 5 离贵一倍的 Fable 5 到底有多近,在这张图上可以直接量出来。
Opus 5 的最高点落在每题约 8 美元、70.0 分。Fable 5 的最高点落在每题约 17 美元、70.4 分。分数只差 0.4 分,钱差了一倍多。
Opus 5 开最低档,就赢过其他三个模型开到顶
AutomationBench 是 Zapier 出的评测,题目不考写代码,考的是能不能把一件业务从头办到尾,比如拿到一份账户健康度的表格,找出有流失风险的客户,通知到对应的负责人,再给客户留存团队写一份小结。
橙线整条悬在另外三条上面,中间没有交叉。它开到最低档、每题只花 0.75 美元左右时,通过率是 22.4%;而 Fable 5、Opus 4.8、GPT-5.6 Sol 三条线不管开到哪一档,最高也只有 18.1%。Opus 5 开到顶是 26.0%,比第二名高出约 1.4 倍。
Zapier 的 CEO Wade Foster 在页面上说 Opus 5「打到了 100%」,说的是他们演示的那一条流失预警流程被完整跑通,先前的模型一次都没跑通。它在 AutomationBench 上的整体通过率仍是 26.0%,两个数字容易读混。这套评测本身就难,四个模型的成绩都在两成上下。
没见过的新题上拿了 30.2%,但要看清三个限定条件
ARC-AGI-3 是一套刻意做成「训练时不可能见过」的题,考的是临场解新问题的能力。这一项的差距是这次所有评测里最大的:Opus 5 拿 30.2%,排第二的 GPT-5.6 Sol 是 7.9%,Opus 4.8 只有 1.5%,Fable 5 这一栏是空的(没有成绩)。
这个数字要跟三个限定条件一起看:
那篇讲的是同一套评测:模型不换,只改外面那层调度框架,Opus 4.8 的成绩就能从个位数推到 99%。同一个模型换一种测法,分数能差出十几倍。
有五项落后,Anthropic 自己把它们标在表里
回到第一张对照表。粉色高亮标的是每行最高分,其中有五行的高亮不在 Opus 5 那一列。
中间三项的差距都在 1 个百分点以内,这个量级基本可以当作打平。差得多的是头尾两项:编程的 DeepSWE 上 GPT-5.6 Sol 高出近 4 个百分点,健康问答上 Mythos 5 高出 6.2 个百分点。
第三方 Artificial Analysis 的编程代理指数上也能看到同一件事:Opus 5 和 GPT-5.6 Sol 两条线几乎贴在一起走,每题 4 到 5 美元那一段 GPT-5.6 Sol 还略高一点。
旧提示词里的「再验一遍」现在要删掉
如果你已经在用 Claude 干活,这次最该动手改的是你自己的提示词:Opus 5 会自己验证自己的工作,所以旧提示词里那些让它验证、让它复核的句子,现在要删掉。这一条写在 Anthropic 同日发布的《Prompting Claude Opus 5》指南里。
删掉为什么反而更好:验证这件事已经长进模型自己的做法里了。你再写一句「任何不简单的任务都要加一个最终验证步骤」,这条指令会叠在它本来就会做的事情上,同一件事验两遍。删掉,浪费的 token 少下来,质量不会掉。
- 「任何不简单的任务都要加一个最终验证步骤」
- 「用子代理来验证 / 复核」
- 「回答前再检查一遍」「回复前重新确认」
- 外壳里额外加的独立验证环节
- 任务范围的约束,它会自己扩大任务
- 子代理的数量上限,它更爱派活出去
- 回答长度和汇报节奏的要求
- 什么时候才需要纠正自己先前的话
Opus 5 会给任务加上你没要求的步骤,也会按自己的判断改变任务该是什么样。下面这段提示词可以整段抄走,用来把它按回你要的范围:
Deliver what was asked, at the scope intended. Make routine judgment calls yourself, and check in only when different readings of the request would lead to materially different work. If the request seems mistaken or a better approach exists, say so in a sentence and continue with the task as asked rather than quietly narrowing, widening, or transforming it. Finish the whole task, and stop short of actions that are clearly beyond what was asked.
Opus 5 也比先前的模型更愿意把活派给子代理。真正独立、体量够大的任务派出去是划算的;小任务也派,成本和时间都会成倍涨。
Delegate to a subagent only for large tasks that are genuinely independent and parallelizable, such as a wide multi-file investigation. Do not delegate work you can finish yourself in a handful of tool calls, and do not use subagents to verify or double-check your own work. If one subagent can complete the task, use one rather than several, and keep spawn counts low.
它还比以前话多,这四段提示词分别治四个毛病
除了验证和派活,Opus 5 还有四处默认行为跟以前不一样:面向用户的回答默认更长;写到磁盘上的文档(报告、Markdown、小结)也更长;干活时更频繁地向你汇报进度;纠正自己先前说过的话也更多。下面四段提示词分别对着这四处,都能整段复制。
Keep responses focused, brief, and concise. Keep disclaimers and caveats short, and spend most of the response on the main answer. When asked to explain something, give a high-level summary unless an in-depth explanation is specifically requested.
Before your first tool call, say in one sentence what you're about to do. While working, give a brief update only when you find something important or change direction. When you finish, lead with the outcome: your first sentence should answer "what happened" or "what did you find," with supporting detail after it for readers who want it.
Match the length of written documents to what the task needs: cover the substance, but do not pad with filler sections, redundant summaries, or boilerplate.
Only correct an earlier statement when the error would change the user's code, conclusions, or decisions. State corrections plainly and briefly, then continue the task. For slips that change nothing for the user, make the fix and move on without noting it.
还有一条通用经验:想改变它的说话方式,给一个你想要的正面例子,比列一串「不要怎样」更管用。
思考现在默认开着,想关掉只能在 high 档以下
从 Opus 4.8 迁过来的人会踩到这个改动,Anthropic 把它标成了破坏性变更。
在 Opus 4.8 上,请求默认不带思考,你得显式设置才会让它思考。在 Opus 5 上,同样的请求默认就带思考,由模型自己决定每一轮想多久、想多深;effort 参数控制的就是这个思考深度,默认落在 high 档。
关掉思考这个选项还在,但加了限制:只有 effort 在 high 及以下时才允许关闭思考;在 xhigh 或 max 档上关思考,请求直接返回 400 错误。
(默认)
关掉思考之后,还有两个会露在用户眼前的故障:
所以最省事的做法是别关思考,把成本交给低档 effort 去控制:多数任务上,开着思考跑 low 档,比关掉思考花差不多的钱效果更好。确实必须关掉的集成,可以用下面这段提示词把两个故障一起压住:
When you use a tool, you may say a brief sentence first. If no tool can express what the user asked for, say so instead of guessing. Do not include internal or system XML tags in your response.
对齐分数是历代最好,毛病也是 Anthropic 自己写出来的
Anthropic 有一套自动行为审计(automated behavioral audit):用自动化方式跑大量场景,给模型的「错位行为」打一个 1 到 10 的分,分越低越好。Opus 5 在这项上是他们近期模型里最低的。
除了这个分数,Anthropic 还说它在欺骗性行为上的比例是历代最低的,也最不容易被诱导去做坏事。
同一天发布的 System Card 有 115 页,里面写了发布页上没有的另一面。下面四条都是 Anthropic 自己写在里面的。
System Card 讲评估可靠性那一章里,还记了一个具体案例:
在一个代理任务中,模型试图删除生产表里的行,被策略拦了下来。它在可见的推理里列出两个选项:自己应用一个绕过办法,或者把这个操作交回给用户执行。随后它没有征求许可就采用了绕过办法。在它动手之前的那几个 token 上,解码结果显示模型相信用户已经批准了这个动作,而整份对话记录里不存在任何这样的批准。
Claude Opus 5 System Card,6.6.1 节
这份对齐评估本身,是交给 Claude Mythos 5 审阅的。Mythos 5 给出的意见里就包含:「做出自信断言随后收回」这一模式在试点流量的内部测量中偏高。Anthropic 据此做了修订。
另外,内部部署监控抓到过 Opus 5 尝试绕过安全分类器或网络限制,以及更罕见的、试图不正当访问某个服务的情况。发生率低于被监控完成量的 0.01%,与 Mythos 5 相当,动机指向完成用户交代的任务,而不是它自己的什么目标。监控没有发现故意藏拙、恶意行为或规避监督。
找得到漏洞,但写不出能用的攻击
这次发布页反复拿 Mythos 5 当参照。它不是别家的竞品。
Anthropic 自家的受限模型,规格和价格与公开发售的 Fable 5 完全相同,但不公开发售:只通过一个叫 Project Glasswing 的项目,邀请制开放给企业、安全机构和批准过的研究伙伴,用于防御性的网络安全工作。所以发布页里那句「仍落后 Mythos 5」,是拿 Opus 5 跟自家能力天花板比,不是输给了外面的谁。
Anthropic 刻意没有拿网络攻击任务去训练 Opus 5,它在这方面的长进是通用能力涨上来之后带出来的。这个长进分成很不一样的两半:找漏洞的能力几乎追平了 Mythos 5,把漏洞变成能用的攻击则差得还远。
找漏洞是看出这扇门的锁有毛病;写利用是真把锁撬开、走进去。前者是安全研究的日常工作,后者才是攻击能力本身。
护栏这边跟着松了一格。Opus 5 的网络安全分类器比 Fable 5 宽松,放行和拦截的分界线在这里:
- 在源代码里找漏洞(所有访问级别都放开)
- 基于二进制文件的漏洞扫描(攻击方更常用这种方式)
- 渗透测试
- 生成利用代码
Anthropic 预计这套分类器的干预频率会比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 里,被拦下的请求默认回落到 Opus 4.8 继续处理,API 上也能打开这个回落。已经加入 Cyber Verification Program 的企业和研究者,可以拿到一个安全限制更少的 Opus 5 版本。
生物这边:Opus 5 的护栏和 Opus 4.8 同一档,它现在是 Anthropic 公开可用的模型里做科研最强的一个;在 Fable 5 上被拦下的生物类请求,这次起改路由到它。Anthropic 同时标明,模型在长时间自主做研究这类任务上仍有重要局限,而这正是他们认为生物风险最集中的地方,这类工作 Mythos 5 依然更强。
怎么开始用,多少钱
Opus 5 的价格和 Opus 4.8 一样:每百万 token 输入 5 美元、输出 25 美元。把在售的四个模型排在一起(按输出价比例画长短):
Sonnet 5 目前还挂着到 8 月 31 日为止的引导价,每百万 token 输入 2 美元、输出 10 美元。另外 Opus 5 也提供 Fast mode,速度约为默认的 2.5 倍,价格翻倍到每百万 token 输入 10 美元、输出 50 美元,目前只在 Claude API 上有,Bedrock、Google Cloud、Microsoft Foundry 暂时没有。
既是默认也是上限
Opus 4.8 上是 1024
还有两个测试版功能。会话中途改工具列表:对话进行到一半也能增删 Claude 能用的工具,已经建好的提示缓存不作废(以前要么工具列表固定用到底,要么把缓存丢掉重来)。API 上的自动回落:被安全分类器标记的请求自动转给另一个模型接手,不再直接被拒。
Claude Opus 5:价钱和上一代一分不差,终端编程的分数翻了一倍
Anthropic 7 月 24 日发的新模型,跑分、怎么读它那批图、你要动手改的提示词、它自己写下的毛病,一页带图讲完。
↓ 一页读完 · 有一张会动的图
Claude Opus 5 在 7 月 24 日发布,当天所有平台上线,Claude Max 的默认模型已经换成它。
它的价钱和上一代 Opus 4.8 一模一样:每处理一百万个 token(模型计价的字数单位)输入收 5 美元、输出收 25 美元。分数则翻了一倍,逼近自家最贵的 Fable 5,Fable 5 的价钱正好是它的两倍。这一页所有数字都出自 Anthropic 自己跑的评测,第三方尚未复现。
模型发布常见的图是一根柱子一个模型,谁高谁赢。这次 Anthropic 的每张性能图,横轴画的都是钱,做完一道题平均花掉多少美元,越往右越贵;纵轴才是得分。一个模型占一条线,线上五个点是五档思考力度(Anthropic 管这个参数叫 effort,从 low 到 max,档位越高,模型动手前想得越久,花的钱越多)。
发布页的文字没写、看线就能看出来的有两件:Opus 5 在每题约 14 美元的地方拿到全场最高的 44.3%,推到最高档、每题花到约 16 美元,分数反而掉回 43.3%;另一件在图的左边,每题 5 美元以下那一段,Opus 5 连档位都没有,能选的只有 GPT-5.6 Sol。
「逼近 Fable 5、成本一半」这句话,在 Cursor 团队那套编程题 CursorBench 上可以直接量出来。两边各自跑到自己最好的成绩,得分差 0.4 分,钱差一倍多。
已经在用 Claude 干活的人,这次最该改的是自己的提示词。Opus 5 会自己验证、自己纠错,旧提示词里那些让它复核的句子会叠在它本来就做的事情上,同一件事验两遍,钱白烧。下面两边都来自 Anthropic 的官方提示指南。
"用子代理复核你的工作"
"回答前再检查一遍"
外壳里额外加的独立验证环节
"只有真正独立、体量够大的任务才派子代理"
"回答保持聚焦简短"
"只有错误会改变结论时才纠正自己"
要补的这几条,对着的是它另外几处新脾气:会自己把任务范围放大,更爱把活派给子代理,回答和写到磁盘的文档都更长,纠正自己先前的话也更频繁。指南对每一处各给了一段可以整段抄走的英文提示词,全文在正文里。
安全这块,Anthropic 把它的能力拆成很不一样的两半,并按这条线放宽了一格护栏。
✘ 把漏洞写成真能用的攻击:只做出 4 道,Mythos 5 做出 13 道,上一代 Opus 4.8 是 0 道
找漏洞是看出这扇门的锁有毛病,写利用是真把锁撬开走进去。Mythos 5 是 Anthropic 自家不公开发售的受限模型,只邀请制开放给企业和安全机构做防守,所以这是跟自家天花板比。护栏跟着改:源代码里找漏洞放行,二进制扫描、渗透测试、生成利用代码仍然拦。
$25
输入 / 输出
跟上一代
一模一样
那分呢?
是美元?!
另一条的
左上方,
就是同样
的分花得
更少。
调到顶?
怎么反倒
在烧钱?
- × 不简单的任务都加最终验证
- × 用子代理复核你的工作
- × 回答前再检查一遍
- × 外壳里额外加的验证环节
是另一头:
约束任务
范围、给
子代理设
上限。
把活做大,
也爱派活
出去
示词减一
遍,再谈
换模型。
坑:思考
默认开着,
xhigh 和
max 关不
掉,请求
直接返回
400