深度 · 小互解读

Anthropic 官方 Opus 5 提示指南:教你删东西,而不是加东西

八段可直接抄的提示词,外加一条反直觉的:审查提示写「只报高危」,它可能真的就少报。
一分钟速览
  • Anthropic 在官方文档里单开了一页,讲你手上已有的提示词换到 Opus 5 之后该改哪几行。整页最反常的地方是:八个板块里有三个在教你删东西
  • 最该删的是「最后加一步验证」「用子代理复核一遍」这类话。Opus 5 自己就会验,这些从上一代抄过来的指令留着只会让它验过头,多烧 token、质量不变
  • 代码审查的提示词要反着写:写「只报高危问题」「保守一点」,它可能当真照做、报得更少。给出的解法是让它全报,另开一轮去筛
  • 它比上一代话多、更爱播报、更爱把活派给子代理。文档给了八段可以直接复制的提示词,一段管住一个毛病
  • 思考现在默认开着,想关掉只允许在 high 档及以下(lowmax 是思考力度的五个档位名,第八节有完整对照表),在 xhighmax 上关思考会直接返回 400 错误
⚑ 材料来自 Anthropic 的官方文档,讲的是自家模型该怎么调,能力描述和推荐档位都是自评口径。文中的五档说明、报错细节和缓存下限来自同一站点的 Effort 文档与迁移指南,正文会逐处标出。
1 这是什么

一份教你删东西的文档

如果你的系统提示词里写着这么一句:「任务做完之后,加一步验证」,那么从换到 Claude Opus 5 的那一刻起,它就在让你多花钱。

Anthropic 给 Opus 5 单独写了一页提示指南,八个板块、一千五百多个英文单词。这八个板块里有三个,讲的是从你的提示词里拿掉东西。

同一份系统提示词,换到 Opus 5 之后
任何不简单的任务,最后都加一步验证。
用一个子代理来复核结果。
回答之前再检查一遍你的答案。
把回答控制在需要的长度。
只有大到真能拆开并行的活才派子代理。
交付被要求的那件事,别自己扩大范围。
左边那三句都是为上一代模型写的。Opus 5 把这些动作做进了默认行为,那三句留着只会让它做两遍。

方向为什么会掉头,逻辑并不绕。过去几年提示工程的主流动作是「加」:模型不肯自查,就写一句逼它自查;模型交半成品,就写一句逼它跑完;模型不验证,就挂一个子代理去复核。这些句子解决的都是短板。

Opus 5 把其中一批短板补掉了。它自己就会验证、会把整个任务做完而不是写一半就交差(不留只有函数名、里面没真干活的占位代码)、会在发现自己写错时回头改。原来那些逼它的句子,现在逼的是它本来就会做的事。

这类指令会让 Claude Opus 5 过度验证,把它们删掉能减少浪费的 token,而质量没有损失。Prompting Claude Opus 5 · Anthropic

要说清楚的是,这一页跟 Opus 5 的发布公告是两份不同的东西。公告讲的是这个模型有多强、多少钱、值不值得换;这一页只讲一件事:换过去之后,你手上那些从 Opus 4.7、4.8 时代抄下来的提示词,该改哪几行。

站内相关
Claude Opus 5 发布解读:一半价钱逼近自家最强的 Fable 5,12 项里仍有 5 项落后
2

先删:所有让它自己验一遍的话

这是整份文档里最该先做的一件事。要删的句子分两类,长得都很眼熟。

第一类是任务级的验证要求,典型写法是「任何不简单的任务都要包含一个最终验证步骤」「用一个子代理来验证」。第二类是回答级的自查要求,典型写法是「再检查一遍你的答案」「回答之前重新确认」。两类的处置一样:删。

同一句提示词,在两代模型上的实际效果
上一代:不写这句,它就真的不验
干活
你要求的那一遍验证
交付
这句话在这里是有价值的,它补上了模型缺的那一步。
Opus 5:它自己已经验过了
干活
它自带的那一遍
你要求的那一遍
交付
同样的产出,多走一轮。这一轮的开销是实的,收益是零。

要删的不止提示词里的句子。文档特意点了一句:那些为了老模型搭的流程脚手架(harness),如果里面有一个单独的验证环节,也要一起拆掉。提示词是你对模型说的话,脚手架是你写在外面的流程代码,管什么时候调模型、调几次、每次给什么。两层都得清。

给 Claude Code 用户的等价落点

这一页整篇站在接口调用的角度写,讲的是系统提示词和外层脚手架。如果你是在 Claude Code 里用它,等价的位置就是 CLAUDE.md 和你自己写的技能文件。对号入座的写法长这样:「改完代码记得叫一个子代理复核一遍」「每步做完自己验证一次再往下」「交付前重新确认所有改动」,这三句现在都该删。这一层文档没有明说,是本站按同一个模型、同一套系统提示推的。

3 反着写

审查提示写「只报严重的」,它会真的少报

这一条最反直觉,也最容易在自己那套自动化流程里踩到。

先看前提:Opus 5 审代码的准确率和覆盖率都高,每一轮能捞出真 bug 的比例很高,而且它多报出来的那些,大部分也是真问题,不是误报凑数。更实用的一点是,这个准确率在思考力度调低时也保持得住,所以审查时可以先用便宜的档位快扫一轮,之后再细审一轮。

问题出在你怎么写筛选条件。如果提示词里有「只报告高严重度的问题」或者「保守一点」,Opus 5 可能按字面执行,于是报得更少。文档给的解法是把筛选从提示词里挪出来:让它全都报,另外开一轮去筛。

写法 A:在提示里筛
「只报高严重度问题」
它替你判严重度。灰掉的那些在它嘴边被吞了,你不知道有过这些,也没法回头翻。
写法 B:全报,再单开一轮筛
「全部报出来」+ 一轮独立筛选
你自己定阈值。全量摆在面前,筛掉哪些、留下哪些,标准在你手上,随时能调。
图为示意:方块数量与比例只用来说明两种写法的差别,不代表实测数据。

两种写法的差别,说到最实处是一句话:谁来定什么算严重。写进提示词,就等于把这个判断交给模型在你看不见的地方做完;单独开一轮,这个判断才在你手上。