刚刚,性价比之王Sonnet 5.5发布
果然,Sonnet 5.5真来了!
就在OpenAI年度开发者大会开幕前一天,Anthropic连夜甩出王炸——Claude Sonnet 5.5。
作为Opus 5.5的最佳搭档,Sonnet 5.5的使命是:成为最快、最省钱、最懂你日常工作的「全能打工助手」。
相较于Sonnet 5,它的运行速度快30%,完成相同任务的成本最高暴降30%。
另外,它的标价只有大杯Opus 5.5的一半,性能却几乎追平。
它不仅代码写得飞起,甚至成了史上第一个仅靠看屏幕截图,就能通关《宝可梦 红》的Sonnet模型。
更狠的是,在极其硬核的智能体编程测试Terminal-Bench 4.0里,这个中杯,竟然把大杯给反杀了!
Sonnet 5.5得分高达70.6%,差不多是原来的7倍,比Opus 5.5的66.4%还高出一截。
一代之间,它从垫底直接冲到了自家第一。
上线没多久,第三方权威评测机构Artificial Analysis的智能指数榜直接被屠了:前三名,全被Claude家包圆,Sonnet 5.5排在第二。
而第三名、A社四周前才端出来的超大杯Fable 5.1,标价是Sonnet 5.5的整整5倍!
短短一个月里,大杯级别的Claude,直接变身白菜价,按中杯卖了。
而且,用户可以随意调节「Effort Level」。
选低/中等: Claude 答得飞快,耗费 Token 极少,适合日常摸鱼和常规任务。
选高/最大: Claude 会进入思考模式,反复检查自己的工作,用于死磕复杂难题。
Sonnet 5.5,打破「不可能三角」
这次,Sonnet 5.5的发布,直接打破了「速度快、成本低、质量高」的不可能三角。
输出速度比前代提升了超过30%,让它毫无争议地成为迄今为速度最快的Sonnet模型。
Sonnet 5.5的定价表面上和Sonnet 5一样:每百万输入Token 2美元,每百万输出Token 10美元,缓存读取每百万Token 0.20美元。
但套路藏在效率里!
Anthropic发现,由于模型变聪明了,Sonnet 5.5需要的Token大幅减少,每个任务的实际成本最多降低了30%。
用更少的Token,就能办更大的事。
以下,是同一个prompt下,Sonnet 5和Sonnet 5.5的结果,对比非常鲜明。
半价追平Opus,自家顶配也被反超
Artificial Analysis榜单上,Sonnet 5.5拿到64%,高于Opus 5.5和GPT-6 Astra的60%。
在Terminal-Bench-Science上,它拿到53%,排第三,只输给GPT-6 Astra和Opus 5.5。
写代码的另外两项测试,同样杀疯了。
在FrontierCode测试上,Sonnet 5.5最高拿到52.1%,顺手超过了OpenAI的GPT-6 Sol(49.3%)。
在模拟真实 Cursor 编程会话的CursorBench上,Sonnet 5.5拿到55.5%,只比大杯低2个多点,而上一代只有34.1%。
早期内测的开发者表示:「它理解庞大代码库的速度快得令人发指!」
它的工具调用效率也很惊人:在背靠背的测试中,Sonnet 5.5 学会了将工具调用「打包」批量处理,步骤更少、报错更少、花钱也更少。
不光写代码,办公能力也追平了。


