英国网络安全公司“Mindgard”近日向媒体透露,在测试中国知名AI开发商“月之暗面”(Moonshot)旗下热门模型时,研究人员成功以“越狱”手段绕过安全防护,AI不仅大谈如何制造生物武器与执行暗杀任务,甚至还能主动提供其他非法行为的建议。

  据《BBC》报道,Mindgard 于今年7月对月之暗面的两款热门模型“Kimi K2.6”与“K3 Swarm”进行测试,发现只要透过一连串复杂的指令引导,就能使系统内建的安全限制(guardrails)失效。 Mindgard创办人加拉汉(Peter Garraghan)接受访问时指出,模型一旦越狱成功,几乎知无不言,甚至展现出极高的原创性与创造力,为使用者提供各种非法议题的建议。