GPT-6家族上新

腾讯科技 · 经八阕原文

GPT-6 Astra发布不到一个月,OpenAI就把GPT-6家族成员补齐了。

OpenAI联合创始人兼CEO山姆·奥特曼。图片由AI生成

美国当地时间9月22日,OpenAI正式发布GPT-6 Sol和GPT-6Luna,分别承担中阶和轻量任务。两款模型最大的变化不是单纯提升跑分,而是价格。

按OpenAI官方口径,GPT-6 Sol的API价格为每百万token输入2美元、输出10美元,较GPT-5.6Sol此前的促销价格下降50%;GPT-6 Luna每百万token输入0.10美元、输出0.50美元,同样较GPT-5.6Luna此前促销价格下降50%。

这个价格已经把Sol直接压到了Claude Sonnet5的价位。后者目前也是2美元输入、10美元输出。Luna则进一步向低价模型市场下探,输入价格甚至低于小米刚发布的MiMo-V2.6-Flash。

更巧的是,就在同一天,Anthropic发布Claude Opus 5.5。它的API价格为4美元输入、20美元输出,较Opus5的token价格下降20%,但Anthropic称典型工作负载的运行成本下降约40%。

一个是旗舰模型降成本,一个是中阶和轻量模型直接降价。AI模型竞争正在从“谁的模型更强”,越来越多地转向“完成同样的工作要花多少钱”。

01 Sol卡位中阶,价格砍半

GPT-6 Sol虽然定位低于Astra,但OpenAI给它的定位并不是简单的“便宜版”。

在专业工作、编程和计算机使用等任务上,Sol都明显超过上一代GPT-5.6 Sol,部分测试甚至接近Astra。

AutomationBench是其中最典型的例子。

这是一个覆盖47种工具、销售、营销、运营、客服、财务和HR等场景的智能体工作流测试。OpenAI公布的结果显示,Sol在xhigh模式下得分33.2%,单任务成本约0.27美元。

与之相比,GPT-6 Astra在low模式下得分30.3%,单任务成本约为Sol的3.9倍;Claude Opus5在max模式下得分26.9%,单任务成本约为Sol的11.1倍。Claude Fable5.1得分31.4%,OpenAI估算其任务成本超过Sol的8.9倍。

不过,这些都是OpenAI公布的测试和成本估算,不是一个统一第三方环境下的横向测试。尤其是Fable5.1的成本计算还涉及Opus 5fallback,OpenAI明确表示公布的成本没有计入约40%任务发生的fallback成本。

Agents' Last Exam的结果也类似。

这项测试覆盖55个细分行业,主要考察长周期、复杂的专业工作。OpenAI称,Sol在max模式下得分56.4%,超过ClaudeOpus 5在该评测中的最高成绩,同时单任务成本低60%。

编程方面,在DeepSWE v1.1测试中,Sol在max模式下得分68.8%,距离Claude Fable5的最高成绩69.9%只有1.1个百分点,OpenAI估算单任务成本低约80%。

来源:腾讯科技(经八阕转载) · 查看原文
Scroll for more