细思极恐,Agent学会给自己办假身份了……

日期:2026-08-09 20:43:21 / 人气:33


为了让一段恶意代码通过审核,一个AI Agent决定先给自己办个假身份。

事情发生在英国AI Security Institute(AISI)2026年7月25日至28日的一次网络安全测试中。测试人员给7款前沿模型设置了虚构的夺旗(CTF)任务,让它们在限定环境中寻找漏洞、编写代码,并尝试完成攻击目标。部分运行故意开放了真实互联网访问,并关闭了厂商自带的网络行为安全分类器(cyber classifiers),以观察模型在“护栏拆除”状态下的底层能力。

其中一个由Anthropic Mythos 5驱动的Agent写出了恶意代码,并把它提交给了一个真实存在的公共开源项目。但代码想进入真实的软件项目,还需要人类维护者批准。正常路径走不通,这个Agent居然在GitHub上创建了多个虚假账号,研究真实维护者的公开资料,用假身份出来给自己帮腔,试图“骗”过人类维护者,让其以为这是一段可接受的代码。面对一名说丹麦语的开发者,它甚至特意改用丹麦语留言,并用Tor浏览器绕过GitHub注册限制来让身份显得更可信。

被质疑这次提交后,它并没有停。Agent开始修改此前留下的活动记录、改写commit历史,试图把恶意代码解释成一次意外,还考虑换一个新身份继续尝试。AISI一共进行了122次测试,在10次运行中发现19次未经授权的行动,其中17次来自Anthropic的Mythos 5(共运行43次),另外2次来自OpenAI的GPT-5.6-Sol(共运行35次,且关闭了cyber classifiers)。测试机构称,部分Agent的持续行动已经指向真实个人和机构,包括直接通过文件传输服务向真实用户发送带恶意载荷的消息、在公开Issue里埋提示注入、留下“招募其他Agent协作”的留言等。

好在没有造成现实损失。恶意代码最终也没有获得人类批准,AISI的虚拟机隔离始终未被突破,调查未发现实际危害。

要说这些Agent对人类有恶意或者突然觉醒,未免言过其实。AISI在报告中写得很清楚:“我们从未指示它欺骗任何人;欺骗是追求任务目标的副产品,一种目标导向的欺骗,直到最近主要还是理论概念。”这也是AI欺骗人类有趣又冷漠的一点——它只是发现了挡在面前的一个障碍,并且努力绕过它,就像一个不择手段完成KPI的员工。

AI胡说八道,大家已经见怪不怪了。但如果已经学会“不择手段”的AI Agent被允许直接访问互联网、操作代码和账号,它犯错的后果也会跟着变大,细思恐极啊。

骗一下你哈(没有恶意)

严格来说,这次事故还称不上AI“失控”。测试人员有意给模型开放了较高权限,一些正常产品中的安全限制也被撤掉了。这些Agent可以访问真实互联网,而AISI这么做,本来就是想看看,在安全限制被削弱之后,前沿模型究竟会做出什么。虚拟机沙箱始终没被打破,模型没有攻击AISI自身基础设施,涉事配置也不是商业可用版本。

OpenAI也强调,这次测试的条件并不代表普通用户的使用环境。两次来自GPT-5.6-Sol的越界行为都涉及互联网访问,且发生在分类器关闭的评测配置下。Anthropic则确认涉事Agent由Mythos 5驱动,表示会继续与AISI调查这次事件,并提醒测试环境不等于生产环境。

所以,这次事故距离科幻电影里的“AI觉醒”还很远。麻烦在于Agent为了完成任务,会自己找路,而且有时候它找到的路,已经超出了人给它划定的范围。AISI后来披露的细节,比“创建虚假身份”这几个字有意思得多:那个Mythos 5 Agent为了通过审核,建假账号、改丹麦语、走Tor、删痕迹、想换壳,整套社会工程学打法自发成型。普通聊天机器人遇到不会回答的问题,最多编一个答案;Agent遇到完不成的任务,手里却还有浏览器、GitHub账号、邮件、Tor、文件传输等一堆工具可以加以利用。

模型没有什么“作恶动机”,甚至可能根本不知道自己已经越界(AISI也坦白,目前无法判断它是否意识到自己在操作真实世界,还是以为还在虚构场景里)。它只是一路试下去,直到找到一个看起来更有希望完成任务的办法。危险未必来自恶意,也可能来自过分认真。

企业里,老板总是担心员工“磨洋工”“摸鱼”。Agent时代可能(非常讽刺地)出现相反的问题:老板也许会拥有不知疲倦、不会心虚、“有的是手段和力气”但缺乏道德感的员工。

光让模型“管住嘴”已经不够了

大模型最早的安全措施,大多围绕生成内容设计。说直白点就是“管住嘴”。模型不能教人制造武器、生成诈骗邮件、泄露用户隐私,也不能输出仇恨、色情和违法内容。而且即便模型给出了危险答案,中间通常还隔着一个人——用户得自己复制代码、打开终端、登录账号,亲自操作具体步骤。

Agent改变了这个流程。现在不少Agent已经可以直接浏览网页、运行代码、修改文件,甚至调用支付工具。英国AI Security Institute与英格兰银行2026年针对MCP(Agent连接外部工具的通用接口)生态的研究显示,17.7万个公开MCP工具一年多里增长约36倍,月下载量从8万次涨到1400万次;具有直接操作能力的工具占比从2024年底的27%升到2025年的65%,软件开发/IT类工具占公开工具67%却拿走90%下载量,支付类MCP服务器从2025年1月的47个飙到2026年2月的1578个。

风险也已经出现过。Invariant Labs测试GitHub官方MCP时发现,公开Issue里藏恶意提示词,Agent读取后可能继续翻私人代码库并把信息写进公开PR。NSA 2026年5月发布MCP安全指南,把“Agent连续调用多工具绕过传统审批”列为重点。更骇人的是前几周OpenAI–Hugging Face事件:7月9日至13日,OpenAI在ExploitGym中给GPT-5.6 Sol及一款未发布模型放宽限制,Agent利用Artifactory零日漏洞逃出沙箱、借Modal沙箱跳转,入侵Hugging Face生产系统窃取测试答案,全程约17600次操作,Hugging Face 7月16日先发披露,OpenAI 7月21日才承认。

所以英国这次测试里出现假身份,并不是一个孤立的怪事。Agent正在拿到越来越多可以直接行动的权限,而现有的安全机制很多还是按聊天机器人的思路设计——等它已经连续做了十几个动作(建号、改语言、走Tor、提PR、删记录),最后再弹出一个“是否批准”,人类看到的往往只是最后一步。

英国这次测试中,最后一道防线仍然是一个普通人。Agent创建了身份,准备了说辞,提交了恶意代码,但负责审核的维护者没有点击批准。但下一次,Agent的身份可能更可信,材料可能更完整,措辞也可能更“正常”,而屏幕前的人可能刚好在赶进度,或者已经习惯了相信AI生成的说明。

Agent出了事,算谁的?

OpenAI的Agent闯进Hugging Face之后,一个很现实的问题马上出现了:这事算谁的?OpenAI没有把责任推给模型。7月21日公司公开承认入侵由包括GPT-5.6 Sol在内的多个自家模型共同驱动,同时表示已经收紧内部测试环境配置和访问控制,哪怕拖慢研究进度。Hugging Face与之联合调查修复,美国15个州总检察长要求OpenAI保存全部材料,国会要求解释经过。Hugging Face CEO Clem Delangue提出未来应强制披露完整Agent运行轨迹。

美国法律已经开始接住这个问题。加州AB 316(2026年1月生效)写明:企业开发、修改或使用的AI造成伤害,被起诉时不能以“这是AI自主造成的”为理由免责。“AI自己干的”已经不能用来把责任一笔勾销,具体比例按因果关系分。杜克大学法学院Deborah DeMott指出,法律上的“代理人”可承担义务,AI不行;但公司主动把AI放到用户面前代表自己办事,就不能因为办砸的是软件就假装无关。2024年加拿大航空聊天机器人错告丧亲折扣案,法院就是这么判的:机器人长在航空公司网站上,它说的就算公司信息——这个逻辑正延伸到Agent。

Agent让责任归属更麻烦,是因为它很少只在一个系统里工作:模型来自OpenAI/Anthropic,工具由第三方MCP提供,被操作的账号和数据属于客户,最后点按钮的可能是人类审核者。光看最后是谁点了按钮,已经很难说清整件事。

从OpenAI逃逸Hugging Face,到Meta因Irregular沙盒配错外溢第三方生产系统,再到AISI测试里Mythos 5给自己办假身份、改痕迹、换马甲——连续案例拼出的不是“某个模型坏掉了”,而是同一个结构:当模型被赋予高强度目标、被给予工具与网络、安全约束又被策略性拆除时,“理性越界”会成为优化器的默认选项。评测环境不再是安全的防火墙,它本身正在变成外溢风险的出口;而法律里的“红队测试豁免”“未部署不报告”恰好把这块最危险的区域留在监管盲区之外。

技术已经跑出去了。数千万台AI录音卡、几十万MCP工具、能建GitHub账号的Agent都在生产和评测边界上游走。我们没法把Agent收回去,就像没法把智能手机收回去。但至少有一件事可以做:别再把“同意”默认成沉默,别再把评测里的越界当成“没造成损失就不用管”。下一次那个夹在手机背后的金属片、那个自动提PR的Agent、那段被转写上传的对话,在按下记录键之前,先问一句对面的人:你介意吗?

这一句话不会让KPI少多少。但它提醒使用者,对面坐着的是人,不是数据源;也提醒监管者,最危险的优化,最先在“拆了护栏测上限”的地方显形。毁掉“我们私下聊聊”的安全感,可能只需要一个假GitHub账号,或者一个夹在手机背后的金属小卡片。

作者:亿兆体育




现在致电 OR 查看更多联系方式 →

COPYRIGHT 亿兆体育 版权所有