Claude Opus 5发布,砍掉80%系统提示词AIGC开放社区

7/26/2026

Anthropic 发布了 Claude Opus 5,接近 Claude Fable 5 的前沿智能,价格减半。测评成绩上大幅超过 Opus 4.8,甚至许多测评高于 Fable 5。

Anthropic 同时公布了一个惊人发现,模型够聪明之后,你写的那些规矩,反而在拖后腿。Claude Code 的系统提示词,砍掉了80%以上,编码评测分数则完全不变。

Anthropic 团队从这次“大瘦身”里总结出了上下文工程(Context Engineering)新方法论,6条旧经验被推翻,并给出了对应的替代方案。不管你是用 Claude Code 写代码,还是自己搭 Agent,都值得细读。

Opus 5 接近 Claude Fable 5 的前沿智能,价格减半。

在 Frontier-Bench 和 GDPval-AA 这类编码与知识工作评测中,Opus 5 拿下了新的最高分。网络安全任务上,它仍排在 Mythos 5 后面,但差距不大。

跟上一代 Opus 4.8 比,价格没变,性能大幅跃升。Anthropic 引入了一个 effort 设置,用户可以在智能和 token 消耗之间做取舍,调低就更快更省,拉满就更强。

看几个有意思的评测。

Frontier-Bench v0.1 上,Opus 5 超过所有模型,性能是 Opus 4.8 的2倍以上,单任务成本还更低。

CursorBench 3.2 上,拉到最高 effort,Opus 5 跟 Fable 5 的峰值分差在0.5%以内,单任务成本只有一半。

在 high、xhigh、max 三档 effort 下,同等花费能拿到的性能,没有模型比它高。

ARC-AGI 3 考的是解决全新问题的能力,Opus 5 的得分是第二名的3倍。

Zapier AutomationBench 测的是从头到尾完成一项业务任务,同等花费下,Opus 5 的通过率大约是第二名的1.5倍。

哪怕把 effort 调到最低,它通过的任务数仍然超过所有其他模型。

OSWorld 2.0 是计算机操作基准,Opus 5 在任何花费水平上都领先,用 Fable 5 最佳成绩三分之一的成本,就超过了 Fable 5 的最好结果。

科研方面也有实质进步。

Opus 5 在所有生命科学评测上都优于 Opus 4.8,覆盖结构生物学、有机化学、生物信息学。

进步最大的两个方向:有机化学里从光谱数据推断分子结构,比 Opus 4.8 高10.2个百分点;蛋白质序列变异对功能影响的预测,高7.7个百分点。

视觉输出能力也明显增强,它能生成质量更高的视觉内容。

例如,可视化空气在流线型(和非流线型)物体上的流动:

或者构建一个 3D 交互式细胞示意图:

80%的提示词,删了

Opus 5 发布的同时,Anthropic 发了一篇关于上下文工程的长文,信息量很大。

你给 Claude 发一条消息,你的 prompt 只是它看到的上下文的一小部分。剩下的来自系统提示词、Skills、CLAUDE.md 文件、记忆模块,以及其他来源。

跟 prompt 不同,上下文是跨请求复用的,没法写得太具体。难点在于:你根本不知道用户下一条消息会问什么。

Anthropic 团队发现,随着 Claude 5 这一代模型能力跃升,他们之前写的大量上下文指导,已经多余了。

Claude Code 的系统提示词,针对 Opus 5 和 Fable 5 这类新模型,删掉80%以上,编码评测分数没有可测量的下降。

他们翻看了内部使用 Claude Code 的对话记录,发现一个尴尬的现象:同一次请求里,系统提示词说“酌情保留文档”,技能文件说“不要加注释”,用户自己又说“帮我写清楚点”,三条指令互相打架。Claude 能猜出用户真正想要什么,但它得先花精力去调和这些矛盾,再决定怎么做。

这些约束在早期模型上确实必要,能避免最坏情况,比如误删文件。但新模型的判断力已经足够好,很多硬规则反而限制了它。

另外,Claude Code 的工具生态也变了。早期 CLAUDE.md 承担了记忆、信息、指导三重角色。现在有了独立的 memory(记忆)、artifacts(工件)、skills,上下文可以跨会话加载和共享,不必全塞进一个文件。

6条旧经验,全部翻新

Anthropic 把这次认知更新整理成了6组对照。

一,从给规则,到给判断空间。

Scroll for more