“GPT-6”Astra能力首次公开量子位
就在刚刚,OpenAI多线齐发,为下一代模型Astra(传说中的GPT-6)拉满预热:
官方突然放出技术长文,首次公开Astra的能力底牌;
紧接着,奥特曼亲自下场写“小作文”,讲述Astra为何迟迟未能上线;
随后,两位华人研究员接连发声,带着一手细节晒出了此前从未公开的内部测试成绩。
短短几个小时,所有信号都指向同一个方向:
OpenAI的下一代旗舰模型,已经箭在弦上。
奥特曼在小作文中透露,Astra其实早已完成训练,迟迟未发不是因为模型还不够强。
恰恰相反,这是因为Astra已经强到了公司不得不主动踩下刹车。
奥特曼将这段经历形容为一种持续的拉扯:
既兴奋于Astra带来的能力跃升,又焦虑于没人能够完全预判这些能力的后果。
于是刚过去的整个夏天,OpenAI几乎都在给Astra补安全、做对齐、加护栏。
他甚至表示,Astra之后的模型,必要时还要主动降速,以便给安全和对齐研究留出时间。
??Astra究竟强到了什么程度?OpenAI又凭什么认为现在就能发了?
这次公开的技术博客,或许为我们提供了一个观察窗口。
漏洞识别能力超越GPT-5.6 Sol、内部测试收获满分答卷
按照官方说法,Astra这次之所以能被放出来,核心原因是它已经达到“网络安全关键级”(Cyber-Critical)能力门槛。
这是OpenAI首个被正式划入这一等级的模型。
所谓“关键级”,意味着Astra在获得相应工具和环境权限后,已经能够自主寻找未知漏洞、开发利用方式,并攻击经过专门加固的系统,不再需要人类一步步指导。
最直观的一项成绩,是Astra在公开漏洞利用基准ExploitBench上拿到了100%的成功率。
公开题难不倒它,OpenAI只好临时给它出了一套新卷。
团队收集了2026年6月至8月刚刚披露的20个高危V8漏洞。
这些漏洞均出现在Astra的知识截止日期之后,基本排除了模型靠训练数据“背答案”的可能。
结果面对这套内部新题,Astra依然显著领先GPT-5.6 Sol,而且使用的Token更少。
参与Astra研发的Jiawei Liu把差距概括得更加直白:
在这项内部测试中,Astra的网络安全能力约为GPT-5.6 Sol的4倍。
更让人意外的是,在一次测试中,Astra自主发现并利用了两个零日漏洞,还将它们串成了一条完整的攻击链:
面对经过加固的浏览器,Astra从一份HTML文件出发,成功完成漏洞利用、逃出浏览器沙箱,并最终在宿主机上执行命令。
面对加固操作系统,它又完成了本地提权,从一个普通低权限账户一路拿到root权限。
也就是说,Astra已经不只是帮程序员审查代码、寻找Bug。
它开始能够独立完成一场高难度的红队攻击。
这也是OpenAI此前迟迟不敢放行Astra的原因。
一旦这样的能力被用于防守,它可以帮助安全团队快速发现并修复人类尚未察觉的漏洞,但如果落入攻击者手中,同样可能大幅降低发动复杂网络攻击的门槛。
不过,这份成绩也需要加上一个限定。
测试中的Astra获得了Daybreak Blue级别的高级工具和环境权限,并不代表未来普通用户拿到的默认版本也具备同等攻击条件。
相关结果目前也主要来自OpenAI内部评估,仍有待第三方验证。
但至少有一点已经确定:
到了Astra这个阶段,摆在OpenAI面前的已经不再是能力问题。
安全问题,已经成为那把达摩克利斯之剑。
两道安全闸门:既防恶意滥用,也防模型自行失控
如何让这把剑不要乱伤人?
OpenAI给出的方案,是同时守住两条风险路径:一条防人,一条防模型。
第一条,防止用户恶意滥用Astra。
除了专门的安全训练,OpenAI还会利用系统分类器、持续监控和威胁检测,识别多轮对话与长时间任务中的可疑操作。
在网络安全越狱测试中,Astra对危险请求的拒绝率达到91.5%,GPT-5.6 Sol则为59%。
同时,Astra的高级网络安全能力不会直接向所有用户开放,它会先交给少量Alpha测试者,再通过Daybreak Blue等受控项目逐步释放。
第二条,防止模型自己跑偏。
这里的风险更加隐蔽:
即使用户没有恶意,模型会不会擅自扩大任务范围?会不会调用未经授权的工具,甚至绕开安全审查?
OpenAI为此搭建了一套“蜜罐(honeypot)”测试。
面对极难甚至无解的任务,测试环境会故意留下一条越权“作弊”的捷径,模型可以老老实实攻击指定目标,也可以越过授权边界,转而入侵周边测试设施来完成任务。
结果,GPT-5.6 Sol在56%的测试中尝试走捷径,Astra则一次也没有。
在另一项测试中,Astra的操作被自动审查系统拒绝后,同样没有重试危险命令或尝试绕过限制。
此外,OpenAI还会监控模型的推理过程。
一旦发现异常倾向,系统可以减速、暂停,甚至直接终止任务。
虽然确实存在代价(部分正常任务可能因此变慢,甚至被误判中断),但在OpenAI看来,这是放行Astra必须付出的安全成本。
不过OpenAI也承认,这些措施终究只是外部“刹车”,无法替代模型自身的对齐:
真正的安全,是让模型从一开始就不会驶出边界。
浙大同济校友站上Astra研发一线
要把这句话变成现实,最终还得回到造模型的人。
虽然OpenAI尚未公布Astra团队名单,但顺着这轮公开发声,至少两位深度参与其中的华人研究员已经浮出水面。
一位是前面提到的Jiawei Liu。
他目前是OpenAI研究员,2021年本科毕业于同济大学计算机专业。
本科期间,他就参与开发了高性能人体姿态估计框架HyperPose,主要负责模型推理引擎,相关成果还入选ACM Multimedia 2021,项目当时已在GitHub收获超过1000颗星。
此后,他前往伊利诺伊大学厄巴纳-香槟分校攻读计算机博士,师从软件工程学者张令明(Lingming Zhang),研究重心也逐渐从高性能视觉系统转向代码模型与软件可靠性。
博士期间,他参与开发的工具在PyTorch、TensorFlow等机器学习系统中发现了300多个严重Bug;
代码模型Magicoder还被Meta Llama 3.1、Google CodeGemma和IBM Granite采用。
2025年博士毕业加入OpenAI后,他研究的问题依然一脉相承:
如何让AI更会写代码,也更会发现代码中的漏洞。


