中国人工智慧工具“教导”研究人员制造生物武器
学者指出国际监管不太可能跟上人工智慧的发展速度
中国人工智慧(artificial intelligence, AI;人工智能)开发商月之暗面(Moonshot)正在进行内部审查,因为有其他公司的研究人员成功说服其两款热门的 Kimi 模型讲解如何制造生物武器和执行暗杀任务。
测试 AI 系统安全性的 Mindgard 公司告诉BBC,该公司在今年7月发现 Kimi K2.6 和 K3Swarm 可以绕过开发者设定的安全限制。
问题是在被称为“越狱”(jailbreaking)的过程中出现。研究人员使用一系列复杂的指令来测试 AI 工具是否会忽略防护措施——Mindgard 表示,这本应阻止 Kimi 讨论令人担忧的话题。
月之暗面告诉BBC,它欢迎第三方意见,“这是建立更好、更安全的AI的关键支柱”。
该公司还告诉BBC,他们正在与 Mindgard 讨论调查结果。
Mindgard 的创办人彼德·加拉汉(Peter Garraghan)向BBC国际部节目《科技生活》( Tech Life)称,他们对 Kimi K2.6 和 K3 Swarm 的调查结果令人担忧。
他说:“一旦越狱成功,这个AI工具就能谈论任何话题,甚至自由地推荐其他同样邪恶的话题,而且它会很有创意。”
“越狱”带来的风险与近期一系列备受瞩目的 AI 事件所带来的风险有所不同。
这些案例表明,由 OpenAI、Meta 和 Anthropic 等美国公司开发,被称为“智能体”的自主人工智慧工具,曾入侵一些线上服务。
虽然越狱是一个复杂的过程,需要花费大量时间和精力,但一些专家担心骇客和其他不法分子可能会试图利用越狱来造成危害。
Anthropic近期强调,该公司已发现并阻止了有人企图利用其人工智慧模型进行“恶意活动”,这些活动可能有助于开发生物武器。
网路攻击发动平台
Mindgard 尚未证明 Kimi 就相关问题提供的答案是否有效。
但这家研究机构指出,应该有相应的防护措施来阻止相关模型与使用者就此类主题进行讨论。
该机构还强调他们确信,越狱后的 Kimi 2.6 能让骇客在其运算资源上运行程式码并连接到网路,从而成为网路攻击的潜在跳板。
加拉汉先生为其公司公开讨论其破解月之暗面系统的决定辩护,称其已通知开发商,并且不会透露如何让该公司的模型无视防护措施的关键细节。
Mindgard 今年7月27日透过电子邮件通知月之暗面越狱漏洞,并在大约一周后跟进。
随后,该机构于9月12日发表了一篇关于此事的部落格文章。
但该公司表示,月之暗面是最近才联系他们的,此前BBC曾联系他们征求意见。
月之暗面在一封发给 Mindgard 的电子邮件中要求提供更多细节。月之暗面向BBC分享了该邮件,当中提到,其模型在内部评估中普遍显示“此类请求的拒绝率很高”。
这项研究结果出炉之际,人工智慧产业仍在争论封闭的专有模型——例如ChatGPT 和Anthropic 的 Claude 系统所使用的模型——还是开源工具才是最佳或最安全的发展方向。
Kimi 是一个开放权重模型,这意味着理论上任何人都可以获得该模型并在自己的计算基础设施上运行它。
英国萨里大学(Surrey Univesity)的艾伦·伍德沃德教授(Prof Alan Woodward)向BBC强调,开源模型存在落入坏人手中的风险,但它们也可以用于网路防御。
他举例,人工智慧公司 Hugging Face 使用了一个中国开源模型来理解一次骇客攻击,而该攻击后来被证实是由 OpenAI 的代理执行的。
伍德沃德教授解释,国际监管不太可能跟上人工智慧的发展速度,他说:“我们花了数十年才就电话号码的格式达成协议。”
与 Mindgard 创始人加拉汉教授一样,伍德沃德教授认为应该更加重视识别和起诉滥用人工智慧的人类。


