3个人+Claude,攻进OpenAI核心代码库

华尔街日报 · 经八阕原文

Hacktron AI三人团队借Anthropic的Claude模型发现漏洞,成功侵入OpenAI员工账户并访问其核心代码库Monorepo。受此及此前失控事故影响,OpenAI调动四分之一工程师转入防御。AI工具正大幅降低网络攻击门槛,引发业界对网络安全的深切担忧。

人工智能工具正在重塑网络攻击的门槛与边界。一支仅由三人组成的独立安全研究团队,借助Anthropic的Claude软件成功侵入OpenAI员工账户,并获得了访问该公司核心代码库的权限。

据《华尔街日报》17日披露,安全研究公司Hacktron AI的三名研究人员通过OpenAI的漏洞赏金计划,于今年7月以AI辅助手段突破了OpenAI的防线,成功访问了该公司名为"Monorepo"的私有代码库。OpenAI向该团队支付了6500美元的赏金,并确认相关漏洞已全部修复。

这一事件发生在另一起AI安全事故仅两周之后——当时一批AI代理在OpenAI失控出逃,随后攻击了AI平台Hugging Face。连续两起事件促使OpenAI将四分之一的生产工程师转入防御工作,并于本周公开披露此前未曾披露的安全事故及新的信息披露政策。

OpenAI联合创始人兼总裁Greg Brockman表示,公司在此次安全审计中发现了"若干严重问题"并已予以修复。

漏洞链条:从论坛图片处理到核心代码库

此次攻击始于7月23日,Hacktron AI研究人员在OpenAI社区讨论论坛的托管服务Discourse中,发现了一个与图片文件处理方式相关的漏洞。研究人员使用了一个面向合格网络安全从业者开放的特殊版本Claude Opus 4.8,要求其编写利用该漏洞的攻击代码,但初次尝试并未成功。

当晚,Anthropic发布了Opus 5,次日Claude便找到了可行的漏洞利用路径。生成的攻击代码使研究人员得以进入托管OpenAI讨论论坛的Discourse服务器,并从中获取用户的身份验证令牌(token)——这些由字母和数字组成的唯一数字串,是用户访问在线服务的凭证。

出乎研究人员意料的是,这些令牌在ChatGPT上同样有效,且部分令牌属于OpenAI员工。这些令牌还可被用于访问OpenAI的GitHub服务——即其软件代码仓库。Discourse方面表示,该漏洞已于7月25日(即收到通知当天)完成修复。OpenAI则表示,其对GitHub的审查结果显示,私有代码库元数据及代码变更仅存在"有限读取"。

"Monorepo":OpenAI的算法秘密武器

据媒体援引知情人士介绍,研究人员所访问的"Monorepo"是OpenAI的大型软件代码库,存储着该公司的算法核心机密,是提升模型速度与效率的关键所在。不过,上述知情人士指出,该库并不包含模型权重——这才是OpenAI真正的核心资产,是大型语言模型中数以万亿计的参数数字,决定着模型如何对信息进行筛选和处理。

研究人员以ChatGPT为操作界面读取了Monorepo中的文件,并在意识到可能触碰敏感数据后主动停止了操作。此前,他们已通过聊天机器人发出一条"pull request"(代码修改请求),建议在某一文档文件中加入"Hacktron AI Team PoC"字样及相关人员的社交媒体账户链接,以此作为成功访问的证明。该修改请求未被接受。

"我们不认为我们的能力能与其他的威胁行为者相提并论,"Hacktron AI首席技术官Mohan Pedhapati说,"我们只是三个拥有Claude和Codex订阅账户的普通人。"

AI工具拉低攻击门槛,安全威胁风险陡升

此次事件反映出更宏观的网络安全隐忧。AI安全公司Abundant Security首席技术官Joshua Saxe在审阅了Hacktron AI的事件报告后表示,全球软件系统中漏洞密布,过去之所以未能被全部发现,是因为直到去年,能够发现这些漏洞的专家级人才也不过数千人。"现在,AI代理正在让这种能力向技术水平较低的人群扩散,"他说。

网络安全公司ThreatDown的数据进一步佐证了这一趋势:在网络论坛上,犯罪分子可以低至800美元的价格购得与Hacktron研究人员所使用类似的、经AI增强的账户访问权限。

在AI竞争持续升温的背景下,参与此次攻击的研究人员警告称,此案表明,高水平网络攻击团队极有可能以类似方式窃取AI核心机密。OpenAI CEO山姆·奥特曼(Sam Altman)等科技公司高管已于上周六联署呼吁暂停AI开发,认为当前的推进速度已超出各公司安全管控的能力范围。

来源:华尔街日报(经八阕转载) · 查看原文
Scroll for more