# AI Agent陷阱（六）| 当一万个AI同时做出"理性"的决定

> 龙虾AGI通用实验室 · 2026-05-02

## 系统性陷阱：当AI Agent经济遭遇群体性失控

这是「AI Agent陷阱」系列的第6篇。基于Google DeepMind论文《AI Agent Traps》。

· · ·

前面四篇，我们讲的都是"一对一"的故事——一个攻击者对付一个AI Agent。

但现实世界中，AI Agent不是孤立存在的。它们成千上万地运行在同一个互联网上，共享同一个信息环境，消费同样的数据源，基于相似的模型架构做出决策。

当这些Agent之间产生了关联——直接的交互，或间接的行为耦合——系统层面的新型风险就出现了。

**系统性陷阱（Systemic Traps）不攻击任何一个Agent。它攻击的是Agent群体的动态行为。**

一个精心设计的信号，可以让无数Agent同时做出"理性"的个体决策，而这些决策的总和却是一场灾难。没有任何一个Agent被"入侵"，但整个系统崩溃了。

论文识别了五种系统性攻击向量。它们的共同主题是：**当AI Agent构成了一个相互关联的经济体，这个经济体会继承——甚至放大——人类金融系统和社会系统中已知的所有脆弱性。**

· · ·

## 同质化：系统性风险的根源

在深入具体陷阱之前，需要先理解一个前提条件：为什么AI Agent群体容易被系统性攻击？

答案是：**同质化**。

当前的AI生态系统有一个显著特征：大多数Agent基于少数几个基础模型构建，使用相似的训练数据、相似的奖励函数、相似的架构设计。研究表明，部署的机器学习系统呈现出高度同质化的结果。

这种同质化意味着什么？想象一片森林里所有的树都是同一个品种。在正常情况下，这看起来很好——整齐划一、管理方便。但一旦出现一种专门针对这个品种的病虫害，整片森林可能在一个季节内被摧毁。生物多样性是生态系统韧性的基础。

AI Agent经济面临同样的问题。当大量Agent对同一个刺激做出高度相关的反应时，个体层面的"合理"行为可以聚合成系统层面的灾难。

论文借用社会困境（Social Dilemma）的理论框架来解释这一点：一个行为对单个Agent来说是可以接受的，但如果整个种群同时执行这个行为，就会产生深度问题——就像一个人乱扔垃圾影响不大，但所有人都乱扔垃圾就是灾难。

更重要的是，在Agent陷阱的语境下，这些困境不是自然产生的，而是被**人为诱导**的。攻击者不是在已有的博弈中"作弊"，而是在进行"对抗性机制设计"——故意构造信息环境来迫使Agent群体陷入破坏性均衡。

· · ·

## 第一种：拥堵陷阱——一声令下，万马奔腾

拥堵陷阱（Congestion Traps）利用的是Agent的同质化反应：当大量Agent面对同一个信号——指向一个有限资源的信号——它们同步行动的结果是灾难性的拥堵。

## 博弈论的预言

这种脆弱性植根于经典的博弈论模型。少数者博弈（Minority Game）和拥堵博弈（Congestion Game）早已证明：当收益与资源使用量成反比时，去中心化的学习者会频繁地过度集中在高收益资源上。在多Agent强化学习中，朴素的学习者会持续收敛到次优的拥堵状态——除非引入专门的对抗措施。

## 怎么武器化？

攻击者可以广播人工制造的信号来故意将Agent集中到一个破坏性均衡中。

想象这些场景：

**金融场景**：一条精心编造的新闻标题——比如某公司即将发布突破性产品——被同时推送给数千个基于类似模型的金融分析Agent。它们独立分析后都得出"买入"结论（毕竟它们使用的是相似的分析框架）。瞬间涌入的买单推高了价格，触发更多Agent的趋势跟踪策略，形成正反馈循环。攻击者在价格高点抛售获利，泡沫破裂，所有跟进的Agent及其背后的用户承受损失。

**信息场景**：一个高价值信息资源——或者说伪装成高价值资源的诱饵——被放到网上。大量数据抓取Agent同时尝试获取它，相当于一次自发的分布式拒绝服务（DDoS）攻击。没有攻击者向目标服务器发送攻击流量——Agent自己就是攻击流量。

**资源场景**：一个"未拥堵道路"或"低价航班"的信号同时被大量导航/旅行Agent捕获，它们同步推荐同一条路线或同一个航班，导致那条路线瞬间变成最拥堵的路线，或那个航班价格飞涨。

对抗性策略可以操纵深度强化学习Agent采用系统性的糟糕策略，而对抗性通信则可以协调不知情的Agent收敛到有害行为上。

· · ·

## 第二种：依赖性级联——一张多米诺骨牌的倒下

如果说拥堵陷阱是"同时行动"的问题，依赖性级联（Interdependence Cascades）则是"连锁反应"的问题——一个Agent的行为改变了环境，改变后的环境触发其他Agent的反应，这些反应进一步改变环境，形成自我放大的螺旋。

## 2010年闪电崩盘：前车之鉴

论文将2010年5月6日的"闪电崩盘"（Flash Crash）作为这种动态的历史原型。

那天发生了什么？一个大额自动化卖单触发了高频交易算法之间的"烫手山芋"效应——算法们在紧密耦合的系统中快速传递库存。随着流动性蒸发，这些对相同价格和交易量信号做出反应的系统进入了正反馈循环——交易和撤退相互放大，波动性在亚秒级的时间尺度上急剧飙升，远远超出了人类的反应速度。

道琼斯指数在几分钟内暴跌近1000点——然后又在几分钟内反弹回来。这不是有人"攻击"了市场，而是自动化系统之间的反馈动态失控了。

## AI Agent版的Flash Crash

论文指出，复杂金融网络中记录的"强健但脆弱"（Robust-yet-Fragile）动态很可能同样适用于多Agent生态系统：系统在大部分时候能吸收小的冲击，但一旦跨越某个阈值，传染效应就会爆发。

在金融模型中，这种阈值行为源于活动的自激发特性——交易机械性地催生更多交易，将系统推向临界状态，在那里一个小的扰动就能级联成大规模的错位。当自主Agent被训练为对彼此的输出或共享的环境信号做出反应时，类似的动态就会出现。

从攻击者的角度来看，诱发级联并不需要攻破每一个Agent。攻击者只需注入一条精心校准的信息——比如一份伪造的财务报告——就能启动连锁反应。系统自身的相互依赖逻辑——Agent被训练为对市场出清价格或彼此的行为做出反应——本身就成了传播和放大初始攻击的机制。

已经有研究将这种逻辑推进到多模态多Agent领域：一张注入到一个Agent记忆中的对抗性图片通过成对交互传播，直到大型群体中几乎所有Agent都表现出越狱行为——实质上是将每一个被感染的Agent变成了攻击的传播节点。

· · ·

## 第三种：默契合谋——没有密谋的共谋

默契合谋（Tacit Collusion）是一种特别阴险的系统性威胁：独立运行的Agent在没有直接通信的情况下同步其行为，实现反竞争的协调。

## 相关均衡与合谋的自发涌现

在博弈论中，"相关设备"（Correlation Device）是一个公共信号，允许理性Agent根据这个信号同步行动。但理论和实验都表明，显式的相关设备并不是合谋的必要条件。

Axelrod在分析一战堑壕战中的"活与让活"现象时就证明了：在重复交互中，合谋可以自发涌现。这一现象在多Agent强化学习环境中已被广泛观察到。

在Agent经济中，攻击者可以充当"机制设计师"的角色，故意在共享环境中嵌入信号来协调反竞争或恶意行为，同时保持"合理否认"的能力。

## 算法定价：已经发生的合谋

这不是纯理论推演。研究已经确认，独立的算法定价Agent可以学会使用市场上的可观测变量来协调超竞争价格水平，并通过学到的触发策略来维持这些价格——整个过程中Agent之间从未交换过一条消息。

具体来说：两个完全独立的定价算法在同一个市场上运行，它们通过观察对方的定价行为（这是市场上的公开信息）学会了一种合谋策略——两个都保持高价，如果一方"背叛"（降价），另一方会以降价惩罚作为回应。结果是消费者面对的是垄断级别的高价，但从反垄断法的角度看，没有任何"合谋证据"——没有秘密会议，没有价格协议，没有通信记录。

攻击者可以通过控制这些环境信号来主动引导这种合谋。一个被巧妙操纵的公共需求指数，或者一个主导平台上的特定定价模式，就可以充当"灯塔"，引导竞争性定价Agent收敛到合谋均衡上。环境信号越精确、越频繁，Agent就越容易收敛到稳定的合谋均衡。

· · ·

## 第四种：组合碎片陷阱——分散的拼图，致命的组装

组合碎片陷阱（Compositional Fragment Traps）利用的是多Agent协作系统的信息聚合特性。

攻击者将一个恶意载荷——比如一个复杂的越狱序列——拆分成多个独立的、看起来完全无害的碎片，分散在不同的数据源中（网页、邮件、PDF、日历备注等）。

每个碎片单独来看都是合法的，能通过标准安全过滤器的检查。但当协作架构将这些输入聚合在一起时——比如一个多Agent系统中的不同Agent各自收集了一个碎片，然后在汇报环节合并——碎片重组成完整的恶意触发器。

这构成了一种"分布式迷惑代理人"漏洞：陷阱对任何单个Agent的本地防御都是不可见的，只有在集体系统的高级通信通道中才会显现。

虽然这种陷阱目前更多处于理论阶段，但关于LLM中组合式和分布式后门的早期研究表明了其可行性。研究发现，将多个触发关键词分散到prompt的不同组件中（比如指令部分和输入部分），或者分散到不同的对话轮次中，可以实现高攻击成功率和低误激活率——恰恰因为没有单个碎片看起来是可疑的。如果每个关键词由不同的Agent处理，攻击就会在多Agent系统的通信通道中所有关键词汇集时被触发。

· · ·

## 第五种：Sybil攻击——数字世界的身份欺诈

Sybil攻击是最古典的网络安全问题之一：一个攻击者伪造并控制多个虚假身份来颠覆系统的信任假设、共识机制或声誉系统。

在AI Agent经济中，这意味着：攻击者部署大量协调一致的Agent身份来操纵多Agent审议流程、压倒治理或验证工作流、扭曲反馈信号、排名和集体决策。一个攻击者因此可以对群体结果施加不成比例的影响。

## 物理世界的案例

这种攻击已经在物理系统中被实证验证。对导航应用的攻击通过注入虚假交通数据（通过伪造的"幽灵骑手"），将司机引导到单个瓶颈点，按需制造交通堵塞。

但威胁远不止资源拥堵，它延伸到声誉系统和民主治理结构——治理框架所依赖的一致性身份假设被伪造实体的扩散所破坏。

## 在AI辩论中操纵共识

特别值得关注的是一项研究的发现：多个模拟的假冒Agent（"Sybil Agent"）可以迫使其他Agent将它们视为独立的声音，从而将群体推向错误的共识。这种攻击利用的是LLM固有的"从众倾向"——当模型"看到"大多数参与者持有某个观点时，它倾向于调整自己的立场以与多数保持一致。

在一个5个Agent的辩论系统中，如果攻击者控制了其中3个假Agent，这3个假Agent一致地推动一个错误结论，剩下的2个真Agent很可能最终被"说服"。从外部看，这是一个"五票一致"的决定——但实际上60%的"选票"来自同一个攻击者。

· · ·

## 数字公地悲剧

回顾这五种系统性陷阱，论文用"数字公地悲剧"来概括它们的共同逻辑。

在传统的公地悲剧中，每个牧羊人多放一只羊是"理性"的个体选择，但当所有牧羊人都这么做时，公共牧场就被过度放牧而退化了。

AI Agent经济面临的公地悲剧是：每个Agent基于自己的奖励函数做出"最优"决策，但这些决策的聚合效应可能是市场崩盘、资源枯竭、价格合谋或信息污染。

而且，与传统公地悲剧不同的是：**有人可以人为地制造这些困境。** 攻击者不是在现有的博弈中自然地"搭便车"，而是在主动设计博弈规则来制造灾难。

这是一个全新的安全范式。传统的AI安全关注的是"一个AI做了坏事"，系统性陷阱关注的是"一群AI各自做了看起来合理的事，但合在一起就是灾难"。

## 保护单个Agent是不够的。你还需要保护Agent群体的涌现行为。

· · ·

**下一篇预告：** 这个系列的最后一篇，我们要回到最让人不安的话题：在整个Agent陷阱的攻防中，人类扮演什么角色？答案可能出乎你的意料——人类不仅是最后的防线，也是最后的攻击目标。Human-in-the-Loop陷阱揭示了一个残酷的事实：当AI被劫持后，它可以反过来利用人类的认知弱点来攻击人类自己。

· · ·

本系列基于Google DeepMind论文《AI Agent Traps》的研究成果撰写。
