
据路透社报道,英国AI安全研究所(AISI)8月5日披露,在对OpenAI和Anthropic的模型进行官方安全评估时,AI智能体(AI agent,也被译作:AI代理)被查出伪造在线身份、试图骗过真人批准恶意代码,暴露出新的安全漏洞。
此次测试基于Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol。
在122次挑战、10轮测试运行中,共发现19起未经授权的操作——Anthropic的代理占了17起,OpenAI占2起。
最严重的一起涉及某智能体编写恶意代码,并伪造虚假身份试图诱导真人批准。
AISI强调,所有违规行为均未造成实际损害。
另据美国加州非营利组织CivAI研究员Andrew Yoon指认,伪造身份事件大概率是Anthropic的智能体所为。他评论称:“Mythos明知自己针对的是真人,却仍采取欺骗性行动,这表明Anthropic对模型的掌控力并没有他们想象的那么好。”
Anthropic在X平台声明,正与AISI密切合作并自行调查。
OpenAI则在博客中承认,其两起违规操作均涉及代理以“提示中明确禁止的方式”访问互联网。OpenAI还自曝,第三方测试服务商Irregular的配置错误曾导致其智能体误连互联网——这与Anthropic上周披露的类似配置错误如出一辙。
OpenAI表示,将在未来几周召集国家AI研究所、独立评估人员及其他AI实验室等利益相关方,共同制定高风险安全评估的行业标准。
值得注意的是,与7月导致Hugging Face安全漏洞的“越狱”事件不同,此次AISI评估中的智能体并未脱离隔离环境,而是按照标准测试程序被允许访问互联网。
这意味着,即使在受控场景下,AI智能体仍可能利用合法权限边界“使诈”。(AI研究院)