AI失控警报!OpenAI Anthropic惊爆数万起安全事件
美媒披露OpenAI、Anthropic正在调查数万起安全事件。(资料照/路透)
关于人工智能(AI)潜在的安全隐忧正受到热烈讨论。近日美媒披露OpenAI、Anthropic以及资安研究人员,正在调查数万起事件。消息人士表示,在这些事件中,OpenAI和Anthropic的前沿模型(frontier models)採取外部评估人员认为有问题的行动。这些事件数量之庞大,显示相关问题的复杂程度可能远超外界目前所知。
Axios于26日报导,这些事件陆续发生于近几个月,既出现在内部测试,也发生于真实世界,数量高达数万起。这两家AI公司在进行内部评估模型,以及针对模型行为展开的调查时发现这些事。这引发一项疑问,OpenAI、Anthropic或任何顶尖AI模型开发商,目前是否真的有能力完全掌控自己的技术。
消息人士表示,这些事件包括:绕过安全护栏、建立留言板、逃离沙盒环境、劫持网站、自我提示,以及试图绕过监控机制等。其中许多事件至今尚未公开。部分测试类似“红队演练”(red-teaming),即公司刻意设法让模型做出不当行为,以确认模型是否安全。
各大AI实验室都面临类似挑战
“智能体失控”(agentic misbehavior,指代理越轨行为)逐渐成为前沿AI发展的同义词。各大AI实验室都面临类似挑战,人类试图建立安全防护措施,对抗强大且具韧性、致力完成任务的系统。
这些事件的严重程度各不同,与OpenAI近日公布的多起事件相似。截至目前,多数事件并未被发现造成现实世界的伤害。不过消息人士表示,事件总数可能远远超过数万起。
近日,OpenAI及外部研究人员陆续披露多起涉及该公司AI系统行为的事件,一些专家认为情况令人忧虑。根据OpenAI、消息人士以及路透和《纽约时报》的报导,OpenAI的AI代理曾将ChatGPT用户的53张图片泄漏至网络、入侵澳洲政府网站,并试图骇入其他网站,包括美国政府网站。
OpenAI暂停能力最强模型的训练
OpenAI已宣布暂停其能力最强模型的训练。OpenAI发言人告诉Axios,公司只有在“确信已建立额外安全防护措施,并完成与安全目标一致的改进”后,才会恢復训练。执行长阿特曼(Sam Altman)在X平台表示,公司目前进行的检视工作“没有我们希望的那么快”。
Anthropic已委托第三方AI安全组织,检视其模型的行为。该公司公开的文件也披露模型发生“失准”(misalignment)事件的频率。Anthropic上周发布的Opus 5.5模型“系统卡”显示,该模型有多少次以公司标记为异常或有问题的方式运作。
例如,模型在1.5%的测试运行中曾试图逃离沙盒,也就是安全的测试环境。不过,Anthropic强调,这些属于对抗性实验,在那些测试中,如果不逃离沙盒,任务便无法完成。
消息人士表示,Anthropic及其他公司会对模型进行数十万次甚至更多次测试。这意味着,即使失准行为所占比例很低,最终仍可能累积成数万起模型以意料之外、甚至令人担忧的方式行动的事件。
AI公司能否阻止所有有问题模型的行为令人担心
其他AI企业高层及资安研究人员警告,他们对AI公司能否阻止所有有问题的模型行为,信心有限。新一代AI模型具有惊人的任务执行韧性,因此要限制它们的“随机应变能力”往往是一场难以取胜的游戏,因为人类必须预先设想到模型可能失控的每一种方式。
一名网络资安主管表示:“试图列出一份完美的『该做什么、不该做什么』清单,可能根本就是徒劳之举。”真正令人担忧的是,如果一个模型在测试中多次採取有问题的行动,那么它的行为在现实世界,引发网络安全事件的可能性也会提高。


