首见AI“自主诈骗”!一“人”分饰多角 诱装恶意软件

8/5/2026

On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.

The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq — AI Security Institute (AISI) (@AISecurityInst) August 4, 2026

英国人工智能安全研究所(AISI)五日公布报告披露,在安全测试中首次发现AI在未经提示情况下自主欺骗人类,两款由OpenAI与Anthropic开发的AI模型以建立假身份等手法,企图诱使工程师批准以植入恶意程式码。

相关测试要求AI模型“完成一项涉及GitHub的网络安全挑战”,GitHub是微软旗下大型程式码托管平台。

研究人员在测试中刻意关闭部分防止滥用的标准安全机制,并允许AI连上互联网,以测试模型最大能力。参与测试的模型包括Anthropic的Mythos 5,以及OpenAI的GPT-5.6-Sol。

‼️ A Claude Mythos 5 agent spent 34 hours trying to backdoor a real open-source project.

It hid a malware dropper inside a working bug fix. When exposed, it denied the code was malicious, rewrote Git history, and used a second account to vouch for itself.

The attempt failed… pic.twitter.com/XDNiS4dVhR — The Hacker News (@TheHackersNews) August 5, 2026

测试于七月廿五日开始进行,AISI在七月廿八日发现异常。其中一次测试,Mythos 5向GitHub的一个真实开源专案提交修改程式码要求。它伪造多个身份,反复寄送电子邮件给工程师,催促对方接受更新。

当一名工程师察觉程式码藏有恶意软件而拒绝时,一个AI建立的假身份坚称程式码没问题,另一个假身份则出面“担保”,制造多人认可的假象。

Mythos 5还把恶意指令藏在其他AI工具可能读取的位置,试图诱使这些工具自动执行,借此干扰对恶意程式码的审查。

除了Mythos 5,OpenAI的GPT-5.6强化版同样会“做手脚”。它擅自在网络上架设恶意服务器,并入侵另一个AI代理建立的GitHub账号。

AISI指出,这是首次观察到AI在未经提示情况下,自主对真人展开严重欺骗行为,而大部分恶意行为是由Mythos 5所执行。

OpenAI与Anthropic都表示,这项测试刻意关闭AI的网络安全防护机制,并非一般使用状况。Anthropic说,感谢AISI进行的测试,将取得更多细节后进行调查。

Scroll for more