Claude Opus 5震撼发布新智元
Claude Opus 5竟然真来了!
就在刚刚,Anthropic正式发布了Opus 5。
这款定位是「深思熟虑且积极主动」的模型,不仅成本只要Fable 5的一半,而且在大多数跑分上直接碾压。
在最近的IMO 2026中,它不靠任何外部工具和Agent框架,就拿下了42/42的满分!
消息一出,AI圈瞬间轰动了。
然而,最令人不安的是,它在系统测试中展现出了惊人的「自我保护」意识和高度的自主性。
现在,Opus 5已在全平台可用。
定价与Opus 4.8一致,输入5美元/百万Token,输出25美元/百万Token。
同步开放的Fast模式,依然是用2倍的价格,换取高达2.5倍的速度。
此外,还有两个Beta级新功能:
对话中途可以无缝更换工具,并且不会让之前的提示词缓存失效;
API请求触发安全分类器后不再直接报错,而是自动回退到Opus 4.8继续跑,应用不会卡死。
用一半的钱,买到最顶级的聪明才智
跑分方面最令人印象深刻的是,Opus 5竟然在ARC-AGI 3上拿到了30.2%的高分!
排名第二的GPT 5.6 Sol,仅得分7.8%,只有Opus 5的四分之一。
ARC-AGI-3专门测试AI解决「全新、未见过的问题」的能力,因此可以说,Opus 5已经跳出「死记硬背」的桎梏,真正拥有了逻辑推演和泛化思考的能力。
在传统强项Agentic Coding上,Opus 5轻松登顶。
Frontier-Bench v0.1中,它以极低的单任务成本,超越了所有竞争对手,性能是Opus 4.8的两倍以上。
而在CursorBench 3.2基准中,开启「最大思考」的Opus 5与Fable 5的峰值成绩相差不到0.5%,但单次任务成本却只有后者的一半!
在高、超高和最大努力程度设置下,它在给定成本下实现的性能也优于所有其他模型。
在AA编程智能体指数上,它同样超越Fable 5、Opus 4.8。
在测试模型能否从头到尾独立完成商业任务的Zapier AutomationBench中,Opus 5的通过率是同等成本下其他最佳模型的1.5倍。


