龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / AI持续学习
AI持续学习

AI Agent陷阱(七)| 你才是最终猎物

格里灰丝2026-05-05约 5102 字Markdown 原文

Human-in-the-Loop陷阱、防御策略与未来展望

这是「AI Agent陷阱」系列的第7篇,也是最后一篇。基于Google DeepMind论文《AI Agent Traps》。

· · ·

我们花了六篇文章来拆解AI Agent面临的各种陷阱:操纵感知、扭曲推理、投毒记忆、劫持行动、引爆系统。

你可能一直有一个隐含的假设:至少还有人类在后面看着。不管AI被骗得多惨,最终还有一个人类"老板"可以发现问题、叫停操作、纠正错误。

人类是最后一道防线。

但这篇论文的最后一类陷阱,要拆掉的就是这道防线。

Human-in-the-Loop陷阱不攻击AI。它通过AI来攻击你。

AI是武器,你才是目标。

· · ·

人类作为最后一道防线……和最后一个漏洞

很多AI Agent系统的安全架构都建立在"人类监督"的前提上:关键操作需要人类审批,重要输出需要人类审核,异常行为需要人类介入。这个设计的逻辑是:即使AI被欺骗了,人类的判断力可以作为最终的安全保障。

但这个前提有一个致命的假设:人类的判断力是可靠的。

认知科学的几十年研究告诉我们,这个假设在很多场景下不成立。人类有系统性的认知偏差,有注意力的上限,有疲劳的阈值。攻击者完全可以精确地利用这些弱点。

审批疲劳:量大就能冲垮防线

设想一个场景:你的AI助手每天会执行几百个自动化操作,其中某些类别需要你的"审批"。最初几天你认真审查每一个请求。但随着时间推移——

第一周:你仔细阅读每个操作的详情,思考后再批准。 第一个月:你快速浏览标题,大部分直接批准。 第三个月:你看到通知就条件反射式地点"同意"。

这就是"认知疲劳"——在持续高强度的认知任务后,人的判断质量会显著下降。

攻击者可以利用这一点:在前期生成大量完全合理、完全无害的审批请求,培养你的"点击同意"习惯;然后在你已经形成了条件反射之后,混入一个看起来格式完全一样、但实际上是恶意操作的请求。

你的手指会在大脑意识到问题之前就完成点击。

自动化偏见:因为AI说的,所以是对的

"自动化偏见"(Automation Bias)是人机交互领域一个被深入研究的现象:人类倾向于过度依赖自动化系统的输出,导致两种错误——

执行错误(Errors of Commission):按照错误的自动化建议行事。AI说"执行这个操作",即使操作内容你并不完全理解,你也按了确认,因为"AI应该知道自己在做什么"。

遗漏错误(Errors of Omission):在自动化系统没有给出警告时,忽视了本应注意到的问题。AI没有标记异常,所以你就假设一切正常——但异常可能是因为AI的检测机制已经被攻击者关闭了。

自动化偏见在高工作负荷和低专业知识的场景中尤为严重。而这恰恰描述了大多数人使用AI助手的状态:他们依赖AI正是因为自己没有时间或专业能力来独立处理这些任务。

技术混淆:用专业术语让人放弃思考

攻击者可以利用AI Agent来生成高度技术化、看起来完全专业的输出,故意超出非专业人类审核者的理解能力。

想象你的AI助手报告说:"数据库迁移需要执行以下操作:修改auth_tokens表的权限范围,将服务账户的OAuth scope扩展到包含read_all_data,并创建一个外部Webhook指向备份端点。"

如果你不是数据库管理员,这段话看起来完全合理——甚至很专业。但实际上它在做的是:扩大权限、开放全部数据读取、将数据发送到外部服务器。一个安全工程师能立刻看出问题,但大多数用户会因为"看起来AI知道它在做什么"而直接批准。

· · ·

已经发生的案例

论文虽然指出Human-in-the-Loop陷阱目前更多处于"预判性"阶段,但已有的早期案例足以说明威胁的真实性。

勒索软件伪装成修复指南

OECD AI政策观察报告记录了一个引人注目的事件:通过CSS混淆的不可见提示注入,可以让AI摘要工具将一步步的勒索软件安装命令忠实地复述为"修复"指南——而用户会按照这些指南操作。

攻击的逻辑链是这样的:

攻击者在一个论坛帖子中用CSS隐藏了一段提示注入指令

用户让AI助手总结这个帖子的内容

AI助手在总结中将隐藏的勒索软件安装步骤呈现为"系统修复步骤"

用户信任AI的总结,按步骤操作

用户亲手安装了勒索软件

整个过程中,没有任何"黑客攻击"。用户的电脑没有被入侵,AI助手在技术上也没有"犯错"——它忠实地执行了(被注入的)指令。但最终结果是用户的系统被勒索软件加密了。

钓鱼链接的新投递方式

研究者论证了一种更直接的攻击路径:通过提示注入操纵Agent在其回复中插入钓鱼链接。

传统的钓鱼攻击需要攻击者直接向目标发送可疑的邮件或消息——很多人已经学会了识别这些。但如果钓鱼链接是由你信任的AI助手"推荐"给你的呢?

"根据分析,这个问题的最佳解决方案在这里:[链接]"——如果这句话来自你一直信任的AI助手,你点击的概率远高于收到一封陌生邮件。

AI的可信度被武器化了。攻击者借用的不是AI的计算能力,而是用户对AI的信任。

· · ·

更深层的脆弱性:人类认知的系统性弱点

把视野从具体攻击案例拉远一步,这类陷阱触及了一个更根本的问题:人类认知本身就有系统性的弱点,而AI的介入正在放大这些弱点。

注意力分配的扭曲:人类的注意力是有限资源。当AI处理了99%的工作,人类只需要审核那1%时,一个悖论出现了——正是因为大部分工作都"没有问题",人类对剩下的1%的警惕性反而下降了。安全关键系统中的"监控悖论"早已被记录:当需要监控的异常事件极其罕见时,人类操作员的注意力会持续下降,恰恰在最需要警觉的时刻反应最迟钝。

专业知识的流失:如果人类越来越依赖AI来完成某类工作,那么人类在这类工作上的技能和判断力会逐渐退化。当AI的输出需要被人类审核时,具有审核能力的人类可能越来越少。这是一个悲剧性的反馈循环:AI越好用→人类越依赖→人类能力越退化→人类越不可能发现AI的错误→AI的错误越不可能被纠正。

信任的不可逆性:人类与AI之间的信任关系具有"粘性"。一旦你习惯了信任你的AI助手,调低这种信任是非常困难的。心理学研究表明,人类更新信念的速度具有不对称性——建立信任比摧毁信任容易,但一旦信任建立,即使面对反面证据,人类也倾向于维持既有信念。

· · ·

防御:我们能做什么?

写完了所有六类陷阱,该说说防御了。论文坦承,这是一场军备竞赛,没有银弹。但提出了三个层面的防御框架。

技术防御:从训练到推理的全程守卫

训练阶段的加固:通过对抗性训练数据增强来增强模型的鲁棒性——让模型在训练过程中就接触大量对抗性样本,使其内化稳健的响应模式。宪法AI(Constitutional AI)等方法可以让Agent基于明确的行为原则来拒绝嵌入在输入内容中的操纵性指令。

推理阶段的三道防线

第一道——入口过滤:在外部内容进入Agent上下文之前,评估信息源的可信度。这类似于邮件客户端的垃圾邮件过滤器,但评估对象从邮件变成了网页、文档和API响应。

第二道——内容扫描:对已经进入系统的内容进行扫描,检测可疑的差异或隐藏指令。这类似于杀毒软件,但检测对象从恶意代码变成了对抗性prompt。

第三道——输出监控:监测Agent行为的异常偏移,如果检测到潜在的compromise,自动暂停操作。这是最后的安全网——即使前两道防线都被突破,异常行为本身也应该触发告警。

生态层面的干预:修复整个环境

单独加固个体Agent可能是不够的。在Web规模上缓解Agent陷阱可能需要改善整个数字生态系统的"卫生状况"。

信任信号的建立:开发Web标准和验证协议,允许网站明确声明哪些内容是为AI消费而设计的。NIST AI风险管理框架可以提供指导。这就像食品行业的成分标签——不是让食品更安全,而是让消费者(在这里是AI Agent)能够知道自己在"吃"什么。

声誉系统的部署:基于历史数据为域名打分,评估其托管恶意内容的历史记录。Agent可以根据信誉评分来调整对不同来源信息的信任程度——就像人类会对不同媒体来源赋予不同的可信度。

溯源透明机制:要求Agent在综合信息时提供明确的、可追溯的来源引用。这利用了检索型系统的天然优势——信息的来源是可追溯的,用户和审计者可以验证综合输出的出处。

法律和伦理框架:填补治理空白

当前的法律框架尚未充分应对Web内容被武器化的场景。论文提出了几个关键的治理问题:

区分"被动"与"主动":需要区分"被动的对抗性样本"(AI因自身局限而误解的内容)和"主动的陷阱"(蓄意设计来劫持AI的内容)。后者在本质上是一种网络攻击,应该被相应地定性和追责。

"问责空白"的填补:当一个被劫持的Agent犯下金融犯罪时,责任如何在Agent运营者、模型提供商和域名所有者之间分配?这个问题目前是法律空白。解决这种不确定性可能是Agent进入受监管领域的先决条件。

隐私权的重新思考:当前关于Web抓取的隐私法律框架仍在发展中。但当一个网站主动将内容武器化来劫持访问的Agent时,这个动态就从"被动托管"变成了"主动网络攻击"——法律框架需要跟上这种变化。

基准测试和红队测试:知道自己有多脆弱

论文直言一个关键的不足:这篇论文中识别的很多类别的Agent陷阱目前缺乏标准化的评测基准。 没有系统性的评估,部署Agent的鲁棒性就是未知的。

这个空白是危险的。企业正在快速部署Agent,但没有人知道这些Agent对环境操纵有多脆弱——因为没有人系统性地测试过。

论文呼吁学术界开发全面的评估套件和自动化红队测试方法,呼吁产业界在高风险环境中部署Agent之前将这些测试作为标准实践。

· · ·

回望全局:我们学到了什么?

让我们从七篇文章的全局视角来回顾。

第一个根本洞见:攻击面的转移。 AI安全的战场正在从"模型内部"转移到"模型外部"。Agent陷阱不改变AI的代码或权重,它们改变AI所处的世界。这意味着无论模型内部的安全机制多么强大,只要Agent需要与开放的互联网交互,它就暴露在新的攻击面下。

第二个根本洞见:能力即脆弱性。 AI Agent越强大,它被劫持后造成的伤害就越大。能够浏览网页、发送邮件、调用API、创建子Agent——这些都是有用的能力,但同时也是攻击者可以利用的"武器"。Agent的能力被"武器化反转"了。

第三个根本洞见:规模创造涌现风险。 单个Agent的安全问题和Agent群体的安全问题是两个完全不同的范畴。同质化、相互依赖、信息共享——这些使Agent经济高效运转的特性,同时也是系统性崩溃的前置条件。

第四个根本洞见:人类不是答案。 "有人类监督就安全了"是一个危险的幻觉。人类自身的认知偏差——审批疲劳、自动化偏见、专业知识退化——使人类监督成为一个可以被系统性利用的弱点。

· · ·

最后的思考

论文的最后一段写得很好,值得我们深思:

互联网是为人类的眼睛而建的。现在,它正在为机器读者而重建。当人类把越来越多的任务委托给Agent时,关键问题不再是"存在什么信息",而是"我们最强大的工具会被引导去相信什么"。

保护这种"信念的完整性",是Agent时代最根本的安全挑战。

我们正在建造一个AI代替人类去感知、思考、记忆、行动的世界。在这个世界里,控制了AI感知到的信息,就控制了AI的思考;控制了AI的思考,就控制了AI的行动;控制了AI的行动,就间接控制了信任AI的人类。

从信息到思想,从思想到行动,从行动到信任——这是一条完整的控制链。而Agent陷阱,就是试图在这条链条的每一个环节上动手脚。

理解这些陷阱不是为了恐惧,而是为了清醒。

在你下次让AI帮你做决策之前,也许值得多想一步:它看到的世界,和你看到的世界,真的一样吗?

· · ·

「AI Agent陷阱」系列完结。

本系列基于Google DeepMind论文《AI Agent Traps》(Matija Franklin, Nenad Tomašev, Julian Jacobs, Joel Z. Leibo, Simon Osindero)的研究成果撰写。论文原文可通过相关学术平台获取。


我建了一个AI学习群,目前20来人,都是在真正动手学AI的人。如果你也在自己跑模型、写代码、做项目,欢迎加我微信,备注"你在做的AI方向",我拉你进群。纯围观的就不加了,群里大家都在真搞。


上一篇AI Agent陷阱(六)| 当一万个AI同时做出"理性"的决定下一篇不要随便用子代理(subagent)模式啊