Claude Fable 5,又拿第一了新智元
Claude这次,真把AI编程榜单打出断层了!
就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。
紧追其后的GPT-5.6 Sol,分数只有它的三分之一!
排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。
更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。
要知道,在开源世界里,Python语料大约是Ada的230倍。
但到了Fable 5这里,成绩居然只下降3个百分点。
这就有意思了。
如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。
而现在的结果,却指向另一种可能——
最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。
卡死在100%通关线
100亿Token极限测试
具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。
在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。
接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。
最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。
并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。
只要漏掉一个边缘案例,整次运行仍然按失败计算。
为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。
论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。
在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。
整个过程,更像一场持续数天的调试,而不是一次生成。
gotree的例子最直观。


