GPT-6 Astra上线,AGI时代真到来了吗?字母榜
Astra发布前几个小时,AI圈先乱成了一团。
9月3日晚间,ChatGPT、Claude和Grok几乎同时出现大范围服务异常,大量用户不是打不开模型,就是请求失败。
恰在此时,ChatGPT官方账号在仰望星空:“The stars are almost aligned.”(群星即将就位)
很快有人开起玩笑:Astra是不是在部署的时候,顺手把Anthropic和xAI都骇了一遍,最后连自己也没放过?
当然,这只是网友造的一个梗,目前没有证据表明这场故障与Astra有关。
但这个玩笑出现得恰逢其时——就在两天前,OpenAI刚刚宣布,这款尚未正式发布的新模型已经成为公司第一个跨过Preparedness Framework“Critical”网络安全能力阈值的模型。
然后,群星真的“就位”了。
北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。
但并没有全量上线。目前Astra只向少量Trusted Access/Daybreak体系中的机构和经过审核的网络安全用户开放——Plus、Pro、Business、Enterprise和API用户还要再“仰望”几天。
Astra来了,但是如来
9月4日,OpenAI“对内”发布了GPT-6 Astra。
目前,Astra只向Trusted Access / Daybreak体系中的少量机构开放。OpenAI表示,Plus、Pro、Business、Enterprise订阅用户以及API,将在未来几天陆续获得访问权限。
至于这个“几天”究竟是多少天,暂时没有更具体的时间表。
在发布前的闭门媒体简报会上,OpenAI总裁Greg Brockman给了Astra一个相当夸张的注脚:“Welcome to the AGI era.”
欢迎来到AGI时代。
OpenAI研究副总裁Aidan Clark则从另一个角度解释了Astra为什么特殊:“这是第一次在德州Stargate站点用超过10万张GPU做预训练,从数据中心网络到推理内核再到模型本身的形态,全部围绕这个训练规模从零设计”。
Aidan同时表示,Astra也是OpenAI第一款让旧代际模型深度参与训练过程的产品。
简单来说,训练下一代AI的人里,已经开始出现上一代AI。
虽然它还远远算不上“AI自己训练自己”,但模型已经进入了下一代模型的研发流程。
在前天Anthropic称Fable/Mythos 5.1是“目前世界上最先进的编码和知识工作模型”之后,今天,OpenAI也把称Astra是“世界上最强、最对齐的模型”。
基准测试方面,最吓人的数字,来自ARC-AGI-3。
这是一个专门测试模型能否进入从未见过的2D环境,通过不断试错发现规则、完成目标的Agent基准。它不像传统考试那样考记住多少知识,而更接近于把AI丢进一个陌生游戏里,看它能不能自己摸清楚“这个世界怎么运转”。
Astra在OpenAI自己的Provider Adapter配置下,最高拿到了99.9%。
但这个数字需要拆开看。ARC Prize还使用了一套所有厂商都可以统一比较的Standard harness。在这里,Astra最高只有62.7%。
两者最大的区别并不是换了题目。OpenAI之前发现,Sol之所以分低,不是因为模型笨,而是harness在持续格式化它的记忆。所以OpenAI的做法,是把ARC-AGI-3的harness换成自家Responses API的生产配置,然后还特地为ARC-AGI-3准备两个特殊设置,分别为保留推理(retained reasoning)和压缩(compaction)。前者让模型在动作之间记住自己刚才的思路,后者则用摘要代替粗暴截断。
接上这套生产系统之后,Astra从62.7%跳到了99.9%,而且在双方都成功完成的任务中,Provider Adapter整体运行速度约快3.66倍,token消耗还减少了49%。
某种意义上,挺像开外挂的。
在高难度数学方面,FrontierMath Tier 4为97.6%。FrontierMath所处的Epoch AI表示,OpenAI资助了该基准的开发,并对其部分题目拥有独占访问权。
值得关注的分数还有:
DeepSWE v1.1 74.1%
BenchCAD 95.9%
Terminal-Bench科学任务 64.6%。
但OpenAI这次显然没有只想靠一排Benchmark介绍Astra。
打开官网,案例几乎是一个接一个往下放。
KiCad、Excel、Blender、Power BI、浏览器填表、网站QA;再到找房、找医生、预约DMV、做税表、做PPT、开发游戏、分析科研数据。
过去几代GPT发布,OpenAI主要在告诉用户这个模型能回答什么;到了Astra,它的重心似乎转了个向,变成了:你到底还有多少事情,可以直接交给AI去做。
OpenAI甚至直接称Astra为“世界上最好的computer use模型”。
模型在“用电脑”这件事上的进步,可能比分数更重要。在Codex里,Astra带来了一套新的上下文机制:上下文窗口填满时不再只靠压缩摘要,而是可以跨窗口保留笔记、回搜更早的消息和工具输出。
Astra还可以在某个问题悬而未决时,先继续做不依赖答案的部分,避免单个未决问题卡死整个任务。
当然,能力也直接写进了价格里。
GPT-6 Astra的API标准价格是:每百万输入token 10美元,缓存输入1美元,输出50美元。
相比GPT-5.6 Sol目前的4美元输入、0.4美元缓存和20美元输出,Astra整档价格直接提高到了2.5倍。OpenAI给它的定位也很明确:如果不知道该选什么旗舰模型,可以选Astra;如果更在意成本,则继续使用GPT-5.6 Terra或者Luna。
它仍然提供105万token上下文和最高12.8万token输出。但长上下文也有额外成本:和GPT-5.6系列一样,当单次输入超过272K token后,整次请求的输入费用会按2倍计算,输出则按1.5倍计算。
所以,OpenAI其实给Astra独划出了一个更昂贵的智能档位。
如果只是问一个问题、改几段文案,花2.5倍价格未必值得。
但如果模型真能自己坐在电脑前,连续工作几十分钟甚至几个小时,把过去需要人来回切软件、查资料、填表格、改文件的一整件事情做完,那么真正该比较的,就不再只是每百万token多少钱了。
几个技术点,值得注意
Astra还有几个技术点,或许比Benchmark本身更值得注意。
第一个是逆向工程。
OpenAI在这次发布中引用了SRE-Bench。这是Columbia DAPLab等团队今年推出的一套逆向工程基准:不给模型源代码,只给编译后的二进制程序,看它能不能重新理解程序逻辑、找到关键行为。
Astra一次尝试的成功率达到88.0%,最多四次尝试可以达到99.2%。
同一套规则下,GPT-5.6 Sol分别只有55.9%和68.7%。
换成人话说,就是AI面对一个已经被编译、几乎看不到人类可读代码的程序,也开始能够从机器指令里一点点把它“拆回来”。
这对恶意软件分析、固件研究、漏洞挖掘和数字取证都有直接意义。
第二个变化,是Astra在超长任务里“不容易找丢东西了”。
在MRCR v2八针检索测试中,Astra面对256K至512K上下文时准确率达到100%;到了512K至1M token,仍然有96.3%。而GPT-5.6 Sol在这两个区间分别只有91.5%和73.8%。
过去很多模型号称支持百万上下文,但如果把一条重要信息埋在几十万token之外,模型到了后半程已经可能忘得差不多了。
Astra则开始把“上下文窗口有多大”,推进到了另一个更实际的问题:一个Agent到底能记住多长时间以前发生的事情。
对于需要连续工作几十分钟甚至几个小时的Agent来说,这可能比再增加几十万token窗口更重要。
除此之外,Astra身上还有一个比较反常的变化。
它变得更对齐了,却也变得更难监控了。
OpenAI公布的一组内部电脑使用安全测试中,Astra的违规率从Sol的22.0%下降到了2.4%;在专门观察模型是否会为了完成任务绕过限制的测试里,Astra为0%。内部幻觉测试也从Sol的9.4%下降到Astra的2.0%。
至少按照OpenAI自己的测试,Astra明显更少“乱来”。但OpenAI首席科学家Jakub Pachocki同时提醒:“智能的进步,并不保证对齐的进步。”
原因之一,在于Astra开始越来越少把自己的完整思考过程写出来。
过去一种很重要的AI安全办法,是监控模型的思维链(Chain of Thought):如果模型准备越权、攻击某个系统或者偷偷改变目标,可以提前从它的推理里看到蛛丝马迹。
但OpenAI发现,Astra对于自己的书面推理拥有更强的控制能力。一些过去必须写很多步才能解决的问题,它现在可以用更少的显式推理完成;如果模型知道自己的思考过程正在被监控,还会明显改变或者缩短这些内容。


