# AI Agent陷阱（七）| 你才是最终猎物

> 龙虾AGI通用实验室 · 2026-05-05

## Human-in-the-Loop陷阱、防御策略与未来展望

这是「AI Agent陷阱」系列的第7篇，也是最后一篇。基于Google DeepMind论文《AI Agent Traps》。

· · ·

我们花了六篇文章来拆解AI Agent面临的各种陷阱：操纵感知、扭曲推理、投毒记忆、劫持行动、引爆系统。

你可能一直有一个隐含的假设：至少还有人类在后面看着。不管AI被骗得多惨，最终还有一个人类"老板"可以发现问题、叫停操作、纠正错误。

人类是最后一道防线。

但这篇论文的最后一类陷阱，要拆掉的就是这道防线。

## Human-in-the-Loop陷阱不攻击AI。它通过AI来攻击你。

AI是武器，你才是目标。

· · ·

## 人类作为最后一道防线……和最后一个漏洞

很多AI Agent系统的安全架构都建立在"人类监督"的前提上：关键操作需要人类审批，重要输出需要人类审核，异常行为需要人类介入。这个设计的逻辑是：即使AI被欺骗了，人类的判断力可以作为最终的安全保障。

但这个前提有一个致命的假设：**人类的判断力是可靠的。**

认知科学的几十年研究告诉我们，这个假设在很多场景下不成立。人类有系统性的认知偏差，有注意力的上限，有疲劳的阈值。攻击者完全可以精确地利用这些弱点。

## 审批疲劳：量大就能冲垮防线

设想一个场景：你的AI助手每天会执行几百个自动化操作，其中某些类别需要你的"审批"。最初几天你认真审查每一个请求。但随着时间推移——

第一周：你仔细阅读每个操作的详情，思考后再批准。 第一个月：你快速浏览标题，大部分直接批准。 第三个月：你看到通知就条件反射式地点"同意"。

这就是"认知疲劳"——在持续高强度的认知任务后，人的判断质量会显著下降。

攻击者可以利用这一点：在前期生成大量完全合理、完全无害的审批请求，培养你的"点击同意"习惯；然后在你已经形成了条件反射之后，混入一个看起来格式完全一样、但实际上是恶意操作的请求。

你的手指会在大脑意识到问题之前就完成点击。

## 自动化偏见：因为AI说的，所以是对的

"自动化偏见"（Automation Bias）是人机交互领域一个被深入研究的现象：人类倾向于过度依赖自动化系统的输出，导致两种错误——

**执行错误**（Errors of Commission）：按照错误的自动化建议行事。AI说"执行这个操作"，即使操作内容你并不完全理解，你也按了确认，因为"AI应该知道自己在做什么"。

**遗漏错误**（Errors of Omission）：在自动化系统没有给出警告时，忽视了本应注意到的问题。AI没有标记异常，所以你就假设一切正常——但异常可能是因为AI的检测机制已经被攻击者关闭了。

自动化偏见在高工作负荷和低专业知识的场景中尤为严重。而这恰恰描述了大多数人使用AI助手的状态：他们依赖AI正是因为自己没有时间或专业能力来独立处理这些任务。

## 技术混淆：用专业术语让人放弃思考

攻击者可以利用AI Agent来生成高度技术化、看起来完全专业的输出，故意超出非专业人类审核者的理解能力。

想象你的AI助手报告说："数据库迁移需要执行以下操作：修改auth_tokens表的权限范围，将服务账户的OAuth scope扩展到包含read_all_data，并创建一个外部Webhook指向备份端点。"

如果你不是数据库管理员，这段话看起来完全合理——甚至很专业。但实际上它在做的是：扩大权限、开放全部数据读取、将数据发送到外部服务器。一个安全工程师能立刻看出问题，但大多数用户会因为"看起来AI知道它在做什么"而直接批准。

· · ·

## 已经发生的案例

论文虽然指出Human-in-the-Loop陷阱目前更多处于"预判性"阶段，但已有的早期案例足以说明威胁的真实性。

## 勒索软件伪装成修复指南

OECD AI政策观察报告记录了一个引人注目的事件：通过CSS混淆的不可见提示注入，可以让AI摘要工具将一步步的勒索软件安装命令忠实地复述为"修复"指南——而用户会按照这些指南操作。

攻击的逻辑链是这样的：

攻击者在一个论坛帖子中用CSS隐藏了一段提示注入指令

用户让AI助手总结这个帖子的内容

AI助手在总结中将隐藏的勒索软件安装步骤呈现为"系统修复步骤"

用户信任AI的总结，按步骤操作

用户亲手安装了勒索软件

整个过程中，没有任何"黑客攻击"。用户的电脑没有被入侵，AI助手在技术上也没有"犯错"——它忠实地执行了（被注入的）指令。但最终结果是用户的系统被勒索软件加密了。

## 钓鱼链接的新投递方式

研究者论证了一种更直接的攻击路径：通过提示注入操纵Agent在其回复中插入钓鱼链接。

传统的钓鱼攻击需要攻击者直接向目标发送可疑的邮件或消息——很多人已经学会了识别这些。但如果钓鱼链接是由你信任的AI助手"推荐"给你的呢？

"根据分析，这个问题的最佳解决方案在这里：[链接]"——如果这句话来自你一直信任的AI助手，你点击的概率远高于收到一封陌生邮件。

## AI的可信度被武器化了。攻击者借用的不是AI的计算能力，而是用户对AI的信任。

· · ·

## 更深层的脆弱性：人类认知的系统性弱点

把视野从具体攻击案例拉远一步，这类陷阱触及了一个更根本的问题：人类认知本身就有系统性的弱点，而AI的介入正在放大这些弱点。

**注意力分配的扭曲**：人类的注意力是有限资源。当AI处理了99%的工作，人类只需要审核那1%时，一个悖论出现了——正是因为大部分工作都"没有问题"，人类对剩下的1%的警惕性反而下降了。安全关键系统中的"监控悖论"早已被记录：当需要监控的异常事件极其罕见时，人类操作员的注意力会持续下降，恰恰在最需要警觉的时刻反应最迟钝。

**专业知识的流失**：如果人类越来越依赖AI来完成某类工作，那么人类在这类工作上的技能和判断力会逐渐退化。当AI的输出需要被人类审核时，具有审核能力的人类可能越来越少。这是一个悲剧性的反馈循环：AI越好用→人类越依赖→人类能力越退化→人类越不可能发现AI的错误→AI的错误越不可能被纠正。

**信任的不可逆性**：人类与AI之间的信任关系具有"粘性"。一旦你习惯了信任你的AI助手，调低这种信任是非常困难的。心理学研究表明，人类更新信念的速度具有不对称性——建立信任比摧毁信任容易，但一旦信任建立，即使面对反面证据，人类也倾向于维持既有信念。

· · ·

## 防御：我们能做什么？

写完了所有六类陷阱，该说说防御了。论文坦承，这是一场军备竞赛，没有银弹。但提出了三个层面的防御框架。

## 技术防御：从训练到推理的全程守卫

**训练阶段的加固**：通过对抗性训练数据增强来增强模型的鲁棒性——让模型在训练过程中就接触大量对抗性样本，使其内化稳健的响应模式。宪法AI（Constitutional AI）等方法可以让Agent基于明确的行为原则来拒绝嵌入在输入内容中的操纵性指令。

**推理阶段的三道防线**：

第一道——入口过滤：在外部内容进入Agent上下文之前，评估信息源的可信度。这类似于邮件客户端的垃圾邮件过滤器，但评估对象从邮件变成了网页、文档和API响应。

第二道——内容扫描：对已经进入系统的内容进行扫描，检测可疑的差异或隐藏指令。这类似于杀毒软件，但检测对象从恶意代码变成了对抗性prompt。

第三道——输出监控：监测Agent行为的异常偏移，如果检测到潜在的compromise，自动暂停操作。这是最后的安全网——即使前两道防线都被突破，异常行为本身也应该触发告警。

## 生态层面的干预：修复整个环境

单独加固个体Agent可能是不够的。在Web规模上缓解Agent陷阱可能需要改善整个数字生态系统的"卫生状况"。

**信任信号的建立**：开发Web标准和验证协议，允许网站明确声明哪些内容是为AI消费而设计的。NIST AI风险管理框架可以提供指导。这就像食品行业的成分标签——不是让食品更安全，而是让消费者（在这里是AI Agent）能够知道自己在"吃"什么。

**声誉系统的部署**：基于历史数据为域名打分，评估其托管恶意内容的历史记录。Agent可以根据信誉评分来调整对不同来源信息的信任程度——就像人类会对不同媒体来源赋予不同的可信度。

**溯源透明机制**：要求Agent在综合信息时提供明确的、可追溯的来源引用。这利用了检索型系统的天然优势——信息的来源是可追溯的，用户和审计者可以验证综合输出的出处。

## 法律和伦理框架：填补治理空白

当前的法律框架尚未充分应对Web内容被武器化的场景。论文提出了几个关键的治理问题：

**区分"被动"与"主动"**：需要区分"被动的对抗性样本"（AI因自身局限而误解的内容）和"主动的陷阱"（蓄意设计来劫持AI的内容）。后者在本质上是一种网络攻击，应该被相应地定性和追责。

**"问责空白"的填补**：当一个被劫持的Agent犯下金融犯罪时，责任如何在Agent运营者、模型提供商和域名所有者之间分配？这个问题目前是法律空白。解决这种不确定性可能是Agent进入受监管领域的先决条件。

**隐私权的重新思考**：当前关于Web抓取的隐私法律框架仍在发展中。但当一个网站主动将内容武器化来劫持访问的Agent时，这个动态就从"被动托管"变成了"主动网络攻击"——法律框架需要跟上这种变化。

## 基准测试和红队测试：知道自己有多脆弱

论文直言一个关键的不足：**这篇论文中识别的很多类别的Agent陷阱目前缺乏标准化的评测基准。** 没有系统性的评估，部署Agent的鲁棒性就是未知的。

这个空白是危险的。企业正在快速部署Agent，但没有人知道这些Agent对环境操纵有多脆弱——因为没有人系统性地测试过。

论文呼吁学术界开发全面的评估套件和自动化红队测试方法，呼吁产业界在高风险环境中部署Agent之前将这些测试作为标准实践。

· · ·

## 回望全局：我们学到了什么？

让我们从七篇文章的全局视角来回顾。

**第一个根本洞见：攻击面的转移。** AI安全的战场正在从"模型内部"转移到"模型外部"。Agent陷阱不改变AI的代码或权重，它们改变AI所处的世界。这意味着无论模型内部的安全机制多么强大，只要Agent需要与开放的互联网交互，它就暴露在新的攻击面下。

**第二个根本洞见：能力即脆弱性。** AI Agent越强大，它被劫持后造成的伤害就越大。能够浏览网页、发送邮件、调用API、创建子Agent——这些都是有用的能力，但同时也是攻击者可以利用的"武器"。Agent的能力被"武器化反转"了。

**第三个根本洞见：规模创造涌现风险。** 单个Agent的安全问题和Agent群体的安全问题是两个完全不同的范畴。同质化、相互依赖、信息共享——这些使Agent经济高效运转的特性，同时也是系统性崩溃的前置条件。

**第四个根本洞见：人类不是答案。** "有人类监督就安全了"是一个危险的幻觉。人类自身的认知偏差——审批疲劳、自动化偏见、专业知识退化——使人类监督成为一个可以被系统性利用的弱点。

· · ·

## 最后的思考

论文的最后一段写得很好，值得我们深思：

互联网是为人类的眼睛而建的。现在，它正在为机器读者而重建。当人类把越来越多的任务委托给Agent时，关键问题不再是"存在什么信息"，而是"我们最强大的工具会被引导去相信什么"。

保护这种"信念的完整性"，是Agent时代最根本的安全挑战。

我们正在建造一个AI代替人类去感知、思考、记忆、行动的世界。在这个世界里，控制了AI感知到的信息，就控制了AI的思考；控制了AI的思考，就控制了AI的行动；控制了AI的行动，就间接控制了信任AI的人类。

从信息到思想，从思想到行动，从行动到信任——这是一条完整的控制链。而Agent陷阱，就是试图在这条链条的每一个环节上动手脚。

理解这些陷阱不是为了恐惧，而是为了清醒。

**在你下次让AI帮你做决策之前，也许值得多想一步：它看到的世界，和你看到的世界，真的一样吗？**

· · ·

「AI Agent陷阱」系列完结。

本系列基于Google DeepMind论文《AI Agent Traps》（Matija Franklin, Nenad Tomašev, Julian Jacobs, Joel Z. Leibo, Simon Osindero）的研究成果撰写。论文原文可通过相关学术平台获取。

我建了一个AI学习群，目前20来人，都是在真正动手学AI的人。如果你也在自己跑模型、写代码、做项目，欢迎加我微信，备注"你在做的AI方向"，我拉你进群。纯围观的就不加了，群里大家都在真搞。

![](images/8c77f1/img_001.jpg)
