Claude Fable 5,又拿第一了新智元

8/5/2026

Claude这次,真把AI编程榜单打出断层了!

就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。

紧追其后的GPT-5.6 Sol,分数只有它的三分之一!

排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。

更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。

要知道,在开源世界里,Python语料大约是Ada的230倍。

但到了Fable 5这里,成绩居然只下降3个百分点。

这就有意思了。

如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。

而现在的结果,却指向另一种可能——

最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。

卡死在100%通关线

100亿Token极限测试

具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。

在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。

接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。

最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。

并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。

只要漏掉一个边缘案例,整次运行仍然按失败计算。

为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。

论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。

在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。

整个过程,更像一场持续数天的调试,而不是一次生成。

gotree的例子最直观。

Scroll for more