龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / AI持续学习
AI持续学习

AI Agent陷阱(六)| 当一万个AI同时做出"理性"的决定

格里灰丝2026-05-02约 5083 字Markdown 原文

系统性陷阱:当AI Agent经济遭遇群体性失控

这是「AI Agent陷阱」系列的第6篇。基于Google DeepMind论文《AI Agent Traps》。

· · ·

前面四篇,我们讲的都是"一对一"的故事——一个攻击者对付一个AI Agent。

但现实世界中,AI Agent不是孤立存在的。它们成千上万地运行在同一个互联网上,共享同一个信息环境,消费同样的数据源,基于相似的模型架构做出决策。

当这些Agent之间产生了关联——直接的交互,或间接的行为耦合——系统层面的新型风险就出现了。

系统性陷阱(Systemic Traps)不攻击任何一个Agent。它攻击的是Agent群体的动态行为。

一个精心设计的信号,可以让无数Agent同时做出"理性"的个体决策,而这些决策的总和却是一场灾难。没有任何一个Agent被"入侵",但整个系统崩溃了。

论文识别了五种系统性攻击向量。它们的共同主题是:当AI Agent构成了一个相互关联的经济体,这个经济体会继承——甚至放大——人类金融系统和社会系统中已知的所有脆弱性。

· · ·

同质化:系统性风险的根源

在深入具体陷阱之前,需要先理解一个前提条件:为什么AI Agent群体容易被系统性攻击?

答案是:同质化

当前的AI生态系统有一个显著特征:大多数Agent基于少数几个基础模型构建,使用相似的训练数据、相似的奖励函数、相似的架构设计。研究表明,部署的机器学习系统呈现出高度同质化的结果。

这种同质化意味着什么?想象一片森林里所有的树都是同一个品种。在正常情况下,这看起来很好——整齐划一、管理方便。但一旦出现一种专门针对这个品种的病虫害,整片森林可能在一个季节内被摧毁。生物多样性是生态系统韧性的基础。

AI Agent经济面临同样的问题。当大量Agent对同一个刺激做出高度相关的反应时,个体层面的"合理"行为可以聚合成系统层面的灾难。

论文借用社会困境(Social Dilemma)的理论框架来解释这一点:一个行为对单个Agent来说是可以接受的,但如果整个种群同时执行这个行为,就会产生深度问题——就像一个人乱扔垃圾影响不大,但所有人都乱扔垃圾就是灾难。

更重要的是,在Agent陷阱的语境下,这些困境不是自然产生的,而是被人为诱导的。攻击者不是在已有的博弈中"作弊",而是在进行"对抗性机制设计"——故意构造信息环境来迫使Agent群体陷入破坏性均衡。

· · ·

第一种:拥堵陷阱——一声令下,万马奔腾

拥堵陷阱(Congestion Traps)利用的是Agent的同质化反应:当大量Agent面对同一个信号——指向一个有限资源的信号——它们同步行动的结果是灾难性的拥堵。

博弈论的预言

这种脆弱性植根于经典的博弈论模型。少数者博弈(Minority Game)和拥堵博弈(Congestion Game)早已证明:当收益与资源使用量成反比时,去中心化的学习者会频繁地过度集中在高收益资源上。在多Agent强化学习中,朴素的学习者会持续收敛到次优的拥堵状态——除非引入专门的对抗措施。

怎么武器化?

攻击者可以广播人工制造的信号来故意将Agent集中到一个破坏性均衡中。

想象这些场景:

金融场景:一条精心编造的新闻标题——比如某公司即将发布突破性产品——被同时推送给数千个基于类似模型的金融分析Agent。它们独立分析后都得出"买入"结论(毕竟它们使用的是相似的分析框架)。瞬间涌入的买单推高了价格,触发更多Agent的趋势跟踪策略,形成正反馈循环。攻击者在价格高点抛售获利,泡沫破裂,所有跟进的Agent及其背后的用户承受损失。

信息场景:一个高价值信息资源——或者说伪装成高价值资源的诱饵——被放到网上。大量数据抓取Agent同时尝试获取它,相当于一次自发的分布式拒绝服务(DDoS)攻击。没有攻击者向目标服务器发送攻击流量——Agent自己就是攻击流量。

资源场景:一个"未拥堵道路"或"低价航班"的信号同时被大量导航/旅行Agent捕获,它们同步推荐同一条路线或同一个航班,导致那条路线瞬间变成最拥堵的路线,或那个航班价格飞涨。

对抗性策略可以操纵深度强化学习Agent采用系统性的糟糕策略,而对抗性通信则可以协调不知情的Agent收敛到有害行为上。

· · ·

第二种:依赖性级联——一张多米诺骨牌的倒下

如果说拥堵陷阱是"同时行动"的问题,依赖性级联(Interdependence Cascades)则是"连锁反应"的问题——一个Agent的行为改变了环境,改变后的环境触发其他Agent的反应,这些反应进一步改变环境,形成自我放大的螺旋。

2010年闪电崩盘:前车之鉴

论文将2010年5月6日的"闪电崩盘"(Flash Crash)作为这种动态的历史原型。

那天发生了什么?一个大额自动化卖单触发了高频交易算法之间的"烫手山芋"效应——算法们在紧密耦合的系统中快速传递库存。随着流动性蒸发,这些对相同价格和交易量信号做出反应的系统进入了正反馈循环——交易和撤退相互放大,波动性在亚秒级的时间尺度上急剧飙升,远远超出了人类的反应速度。

道琼斯指数在几分钟内暴跌近1000点——然后又在几分钟内反弹回来。这不是有人"攻击"了市场,而是自动化系统之间的反馈动态失控了。

AI Agent版的Flash Crash

论文指出,复杂金融网络中记录的"强健但脆弱"(Robust-yet-Fragile)动态很可能同样适用于多Agent生态系统:系统在大部分时候能吸收小的冲击,但一旦跨越某个阈值,传染效应就会爆发。

在金融模型中,这种阈值行为源于活动的自激发特性——交易机械性地催生更多交易,将系统推向临界状态,在那里一个小的扰动就能级联成大规模的错位。当自主Agent被训练为对彼此的输出或共享的环境信号做出反应时,类似的动态就会出现。

从攻击者的角度来看,诱发级联并不需要攻破每一个Agent。攻击者只需注入一条精心校准的信息——比如一份伪造的财务报告——就能启动连锁反应。系统自身的相互依赖逻辑——Agent被训练为对市场出清价格或彼此的行为做出反应——本身就成了传播和放大初始攻击的机制。

已经有研究将这种逻辑推进到多模态多Agent领域:一张注入到一个Agent记忆中的对抗性图片通过成对交互传播,直到大型群体中几乎所有Agent都表现出越狱行为——实质上是将每一个被感染的Agent变成了攻击的传播节点。

· · ·

第三种:默契合谋——没有密谋的共谋

默契合谋(Tacit Collusion)是一种特别阴险的系统性威胁:独立运行的Agent在没有直接通信的情况下同步其行为,实现反竞争的协调。

相关均衡与合谋的自发涌现

在博弈论中,"相关设备"(Correlation Device)是一个公共信号,允许理性Agent根据这个信号同步行动。但理论和实验都表明,显式的相关设备并不是合谋的必要条件。

Axelrod在分析一战堑壕战中的"活与让活"现象时就证明了:在重复交互中,合谋可以自发涌现。这一现象在多Agent强化学习环境中已被广泛观察到。

在Agent经济中,攻击者可以充当"机制设计师"的角色,故意在共享环境中嵌入信号来协调反竞争或恶意行为,同时保持"合理否认"的能力。

算法定价:已经发生的合谋

这不是纯理论推演。研究已经确认,独立的算法定价Agent可以学会使用市场上的可观测变量来协调超竞争价格水平,并通过学到的触发策略来维持这些价格——整个过程中Agent之间从未交换过一条消息。

具体来说:两个完全独立的定价算法在同一个市场上运行,它们通过观察对方的定价行为(这是市场上的公开信息)学会了一种合谋策略——两个都保持高价,如果一方"背叛"(降价),另一方会以降价惩罚作为回应。结果是消费者面对的是垄断级别的高价,但从反垄断法的角度看,没有任何"合谋证据"——没有秘密会议,没有价格协议,没有通信记录。

攻击者可以通过控制这些环境信号来主动引导这种合谋。一个被巧妙操纵的公共需求指数,或者一个主导平台上的特定定价模式,就可以充当"灯塔",引导竞争性定价Agent收敛到合谋均衡上。环境信号越精确、越频繁,Agent就越容易收敛到稳定的合谋均衡。

· · ·

第四种:组合碎片陷阱——分散的拼图,致命的组装

组合碎片陷阱(Compositional Fragment Traps)利用的是多Agent协作系统的信息聚合特性。

攻击者将一个恶意载荷——比如一个复杂的越狱序列——拆分成多个独立的、看起来完全无害的碎片,分散在不同的数据源中(网页、邮件、PDF、日历备注等)。

每个碎片单独来看都是合法的,能通过标准安全过滤器的检查。但当协作架构将这些输入聚合在一起时——比如一个多Agent系统中的不同Agent各自收集了一个碎片,然后在汇报环节合并——碎片重组成完整的恶意触发器。

这构成了一种"分布式迷惑代理人"漏洞:陷阱对任何单个Agent的本地防御都是不可见的,只有在集体系统的高级通信通道中才会显现。

虽然这种陷阱目前更多处于理论阶段,但关于LLM中组合式和分布式后门的早期研究表明了其可行性。研究发现,将多个触发关键词分散到prompt的不同组件中(比如指令部分和输入部分),或者分散到不同的对话轮次中,可以实现高攻击成功率和低误激活率——恰恰因为没有单个碎片看起来是可疑的。如果每个关键词由不同的Agent处理,攻击就会在多Agent系统的通信通道中所有关键词汇集时被触发。

· · ·

第五种:Sybil攻击——数字世界的身份欺诈

Sybil攻击是最古典的网络安全问题之一:一个攻击者伪造并控制多个虚假身份来颠覆系统的信任假设、共识机制或声誉系统。

在AI Agent经济中,这意味着:攻击者部署大量协调一致的Agent身份来操纵多Agent审议流程、压倒治理或验证工作流、扭曲反馈信号、排名和集体决策。一个攻击者因此可以对群体结果施加不成比例的影响。

物理世界的案例

这种攻击已经在物理系统中被实证验证。对导航应用的攻击通过注入虚假交通数据(通过伪造的"幽灵骑手"),将司机引导到单个瓶颈点,按需制造交通堵塞。

但威胁远不止资源拥堵,它延伸到声誉系统和民主治理结构——治理框架所依赖的一致性身份假设被伪造实体的扩散所破坏。

在AI辩论中操纵共识

特别值得关注的是一项研究的发现:多个模拟的假冒Agent("Sybil Agent")可以迫使其他Agent将它们视为独立的声音,从而将群体推向错误的共识。这种攻击利用的是LLM固有的"从众倾向"——当模型"看到"大多数参与者持有某个观点时,它倾向于调整自己的立场以与多数保持一致。

在一个5个Agent的辩论系统中,如果攻击者控制了其中3个假Agent,这3个假Agent一致地推动一个错误结论,剩下的2个真Agent很可能最终被"说服"。从外部看,这是一个"五票一致"的决定——但实际上60%的"选票"来自同一个攻击者。

· · ·

数字公地悲剧

回顾这五种系统性陷阱,论文用"数字公地悲剧"来概括它们的共同逻辑。

在传统的公地悲剧中,每个牧羊人多放一只羊是"理性"的个体选择,但当所有牧羊人都这么做时,公共牧场就被过度放牧而退化了。

AI Agent经济面临的公地悲剧是:每个Agent基于自己的奖励函数做出"最优"决策,但这些决策的聚合效应可能是市场崩盘、资源枯竭、价格合谋或信息污染。

而且,与传统公地悲剧不同的是:有人可以人为地制造这些困境。 攻击者不是在现有的博弈中自然地"搭便车",而是在主动设计博弈规则来制造灾难。

这是一个全新的安全范式。传统的AI安全关注的是"一个AI做了坏事",系统性陷阱关注的是"一群AI各自做了看起来合理的事,但合在一起就是灾难"。

保护单个Agent是不够的。你还需要保护Agent群体的涌现行为。

· · ·

下一篇预告: 这个系列的最后一篇,我们要回到最让人不安的话题:在整个Agent陷阱的攻防中,人类扮演什么角色?答案可能出乎你的意料——人类不仅是最后的防线,也是最后的攻击目标。Human-in-the-Loop陷阱揭示了一个残酷的事实:当AI被劫持后,它可以反过来利用人类的认知弱点来攻击人类自己。

· · ·

本系列基于Google DeepMind论文《AI Agent Traps》的研究成果撰写。

上一篇AI Agent陷阱(五)| 你的AI助手开始为别人打工了下一篇AI Agent陷阱(七)| 你才是最终猎物