倒反天罡:蒸馏小模型,超过了教师量子位
蒸馏出来的学生模型,把当老师的反超了。
Thinking Machines今天放出Inkling-Small,总参数276B、激活12B,体量大约是Inkling大杯板的四分之一。
成绩单是这样的:HLE 31.6%对29.7%,SWEBench Verified突破80%对77.6%。
通用推理和智能体编程两条线上,学生都站到了老师前面。
蒸馏出来的小模型在个别指标上超过教师还不算,真正值得琢磨的是官方给反超公开的秘密配方。
过去说“小模型超过大模型”,大概率是挑了一个最有利小模型的思考强度档位,和一个最有利的基准。
这次不太一样。
Humanity’s Last Exam上,Inkling-Small得31.6%,高于Inkling的29.7%,
而且在同等算力成本下几乎都成立,小模型的test-time compute曲线自始至终位于大模型之上。
如果把几周前随Inkling一起发的Inkling-Small预览版拉过来对照,进步的幅度就更清楚了:HLE纯文本从29.6%到31.6%,SWEBench Verified从77.4%到80%以上,Audio MC从49.6%到54.9%。几个月时间,同一个模型家族里的小号自己又往上走了一截。
但这份公告同时也澄清了小模型能力的边界。
大模型在知识覆盖和事实性上依然占优,Inkling-Small的预览版阶段SimpleQA Verified是20.9%,Inkling那边是43.9%,差了一倍还多。
预览版在Terminal Bench 2.1上是52.7%,同期Inkling是63.8%,而且Inkling那个成绩里还有少量被判定为受网页搜索污染的解答被直接记了0分。
所以更适合这样理解:小模型追上来的是推理和编程这类靠训练强化的能力,追不上的是靠参数量的硬知识含量。
后发优势,具体改了三件事
Inkling-Small是在Inkling之后才开始训练的,这个时间差被团队完整地利用了。
第一步在预训练,团队调整了Inkling-Small的预训练数据配比和机器学习recipe。
第二步在后训练,预览版检查点的后训练部分用了以Inkling作为教师的在线策略蒸馏。
第三步是从预览检查点接着往下走,专门针对智能体编程又扩展了两周的强化学习。
这三步里最关键的是后两步的叠加关系:小模型先吃到了大模型的知识蒸馏,然后又额外拿到两周的专项RL加成。
说明在同一套post-training方法上继续投算力,回报还没到边际递减的位置。
■ 翁荔刚走,Thinking Machines甩出新模型(组图)
■ GPT-5.6一夜爆砍80%(组图)


