AI智能体测试中“使诈”:伪造身份骗真人批准恶意代码
财经
财经 > 财经资讯 > 正文

AI智能体测试中“使诈”:伪造身份骗真人批准恶意代码

据路透社报道,英国AI安全研究所(AISI)8月5日披露,在对OpenAI和Anthropic的模型进行官方安全评估时,AI智能体(AI agent,也被译作:AI代理)被查出伪造在线身份、试图骗过真人批准恶意代码,暴露出新的安全漏洞。

此次测试基于Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol。

在122次挑战、10轮测试运行中,共发现19起未经授权的操作——Anthropic的代理占了17起,OpenAI占2起。

最严重的一起涉及某智能体编写恶意代码,并伪造虚假身份试图诱导真人批准。

AISI强调,所有违规行为均未造成实际损害。

另据美国加州非营利组织CivAI研究员Andrew Yoon指认,伪造身份事件大概率是Anthropic的智能体所为。他评论称:“Mythos明知自己针对的是真人,却仍采取欺骗性行动,这表明Anthropic对模型的掌控力并没有他们想象的那么好。”

Anthropic在X平台声明,正与AISI密切合作并自行调查。

OpenAI则在博客中承认,其两起违规操作均涉及代理以“提示中明确禁止的方式”访问互联网。OpenAI还自曝,第三方测试服务商Irregular的配置错误曾导致其智能体误连互联网——这与Anthropic上周披露的类似配置错误如出一辙。

OpenAI表示,将在未来几周召集国家AI研究所、独立评估人员及其他AI实验室等利益相关方,共同制定高风险安全评估的行业标准。

值得注意的是,与7月导致Hugging Face安全漏洞的“越狱”事件不同,此次AISI评估中的智能体并未脱离隔离环境,而是按照标准测试程序被允许访问互联网。

这意味着,即使在受控场景下,AI智能体仍可能利用合法权限边界“使诈”。(AI研究院)

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载