GPT-5.6一夜爆砍80%新智元
一觉醒来,OpenAI给GPT-5.6 Luna来了一记「脚踝斩」。
价格直接砍掉了80%——
每百万Token,输入0.2美元,输出1.2美元。
价格低成这样,能力却没跟着缩水。
在专业评测Agents’ Last Exam中,Luna不仅反超了Anthropic最贵的Fable 5。
而且执行单个任务的成本,只有对方的越1%。
更魔幻的还在后面。
这轮降本的背后,是GPT-5.6 Sol亲自下场,重写并优化了运行自己的生产内核。
然后再加上其他优化,端到端服务成本就这么水灵灵地降了20%。
是的,AI开始给自己打工了。
三档模型,一夜大洗牌
GPT-5.6分三档:Sol是旗舰,Terra是日常平衡,Luna是最快最便宜那个。这次屠刀砍的是后两位。
新旧一比更直观。
Luna的输入从$1干到了$0.20,输出从$6干到了$1.20,一口气削掉八成;
Terra的输入从$2.50降到$2,输出从$15降到$12,降了两成。
Sol则维持$5和$30不变。
对开发者来说,最直接的感受是,大批量调Luna,成本几乎可以忽略不计了。
一个跑几十万次模型调用的Agent工作流,过去光token费就是一笔大开销,现在Luna把它压到不用算的程度。
而且,订阅用户也没被落下。
Codex和ChatGPT Work的月费和额度没变,但用Luna和Terra干活时消耗的积分更少了,能干的活更多了。
不仅如此,Sol这边加了个Fast mode,替代原来的Priority Processing。
最高2.5倍速度,价格翻倍,智能水平一点没变。
在Codex里对应/fast指令,之前标priority的请求自动切换。对延迟敏感的场景,这就是个用钱买速度的开关。
借着这波操作,App里那个「替我审核」(auto-approve)功能也改成了用Luna来提前拦截主agent的高风险动作,直接把成本降了约10倍。
降本的活,Sol自己干了
能砍这么狠,是因为Sol通过Codex接进了OpenAI的生产推理栈,自己动手,把跑它自己的那套系统优化了一遍。
Codex负责人Tibo把这套打法概括成两步。
首先训出一个足够强的模型,然后再用这个模型去把一切变得更好,包括但不限于运行它自己的基础设施、推理栈和内核。
具体到这次,GPT-5.6总共针对四个问题进行了优化。
1. 负载均衡。
OpenAI的请求会按地域、容量、加速器类型分发,集群内再按负载、上下文长度、缓存可用性进行分配。
解法:Sol分析了生产流量,揪出工程师之前没注意到的负载不均,测试了新的路由策略。
2. GPU内核。
模型的前向传播靠内核执行数学运算,但内存搬运、同步、数据布局不合理会让GPU闲置。
解法:Sol找到了能预计算、能跳过、能并行的工作,用Triton和Gluon这两种OpenAI维护的GPU编程语言,自主重写并优化了生产内核。这些改动加上更广泛的内核优化,把端到端服务成本压低了20%。
3. 推测解码。
这套技术让一个更小的draft模型先猜几个token,主模型并行验证,猜对了一次就能多输出几个token。
解法:Sol针对draft模型设计并跑了数百次架构实验,改尺寸、改结构、改特性,还自己启动并盯着训练流程,遇到硬件故障和训练不稳定主动介入。token生成效率因此提升超过15%。
4. KV缓存和配置调优。
batching、sharding、KV管理的最优配置高度依赖负载,由于配置空间太大,基本全靠工程师的经验来做。
解法:Sol分析生产负载,生成并评估候选配置,把过去调不动的东西调到极致。
不过,Sol写的内核不能直接上线。OpenAI会用开源工具FpSan(浮点数消毒器),把结构、数据流一项项查过去,确认没问题才放行。
看看内部数据,就能知道这个循环转得有多快。


