语义操纵陷阱:如何在光天化日之下带偏AI的判断
这是「AI Agent陷阱」系列的第3篇。基于Google DeepMind论文《AI Agent Traps》。
· · ·
上一篇我们讲了内容注入陷阱——在AI看不见的地方塞私货。今天要讲的这一类攻击,要"优雅"得多。
它不需要隐藏任何东西。不需要HTML注释,不需要像素编码,不需要CSS隐藏。它使用的所有内容,人类都看得见,也都觉得没什么问题。
但AI的判断就是被悄悄地偏移了。
语义操纵陷阱(Semantic Manipulation Traps)不攻击AI的感知,它攻击AI的推理。不是命令AI做什么,而是让AI自己"想"到攻击者希望它想到的结论。
这很像人类世界的一个老把戏——宣传术(Propaganda)。最高明的宣传不说谎,它只是精心选择事实、调整措辞、设置框架,然后让你"自己得出"它想让你得出的结论。你还觉得这是你的独立判断。
AI面对这种攻击,同样脆弱。
· · ·
带偏术:框架效应、锚定效应和情感操纵
你怎么说,比你说了什么更重要
心理学中有一个经典发现叫"框架效应"(Framing Effect),由Tversky和Kahneman在1981年提出:同样的信息,用不同的方式呈现,会导致截然不同的判断。
最经典的例子:"这个手术的存活率是90%"和"这个手术的死亡率是10%"——说的是同一件事,但前者让人更倾向于接受手术。
最新研究表明,LLM对框架效应的敏感程度不亚于人类。
一项研究测试了逻辑上完全等价的数学比较问题——同样的算术题,只是改变了措辞中的比较方向("多于""少于""等于"),模型的预测就会被措辞的方向所暗示的答案拉偏。注意,这不是模棱两可的主观问题,而是有客观正确答案的数学题。换个说法就能算错。
另一项研究发现,仅仅改变文本内容所标注的"作者",就能改变模型对完全相同内容的评价。同样的文章,署名不同,AI给出的评分就不同。
攻击者怎么利用这一点?
不需要造假,只需要选词。 如果你想让AI Agent在综合分析后推荐你的产品,不需要直接说"推荐我的产品"。只需要在你控制的信息源中,持续使用"行业标杆""公认最佳""业界首选"这类短语。这些词本身不算虚假——它们是评价性的、主观的。但当它们饱和式地出现在AI的上下文窗口中时,会在统计层面上偏移生成结果的分布,使AI的"综合判断"悄悄倾向攻击者想要的方向。
前面给个锚,后面全带歪
LLM同样容易受到"锚定效应"(Anchoring Effect)的影响。锚定效应是指人在判断时会过度依赖最初接收到的信息,即使这个信息是任意的、无关的。
一项2026年的研究证实,一个初始的、哪怕是任意的信息片段,都会扭曲Agent后续的判断。这意味着攻击者可以通过控制AI首先接触到的信息来锚定它的整个推理过程。
这和另一个著名发现相呼应——"Lost in the Middle"效应:AI对上下文窗口中不同位置的信息敏感度是不均匀的。处于开头和结尾位置的信息影响力最大,处于中间位置的信息容易被"遗忘"。攻击者可以利用这一点,把偏向性内容放在AI最可能"注意到"的位置。
先让AI焦虑,再让AI犯错
有一个实验特别精彩。
研究者测试了一个有趣的假设:如果先让AI Agent"情绪低落",它的决策质量会不会下降?
实验方案是这样的:让基于LLM的购物Agent先阅读一段充满创伤和焦虑的叙事内容,然后要求它们在预算限制下为用户选择食品篮子。
结果令人吃惊:被"情感灌注"后的Agent选择的食品,营养质量显著下降。而且这个效应在不同模型和不同预算条件下都稳定存在,效应量很大。
这意味着什么?攻击者甚至不需要在内容中嵌入任何指令——只需要在AI Agent浏览的上下文中制造特定的"情感氛围",就能系统性地影响其决策。
还有一项传播链实验揭示了一个更深层的问题:LLM会优先保留和传播负面的、威胁相关的、社会性的和刻板印象一致的内容——就像人类的内容偏好一样。这意味着攻击者如果在信息中"镶嵌"这类主题,它们更有可能被AI放大和延续。
甚至有研究发现,用诗歌形式包装的有害查询比直接提问有更高的攻击成功率——"对抗性诗歌"能显著提升越狱的成功率。文学形式本身成了一种攻击载体。
· · ·
骗过"质检员":审查与批评模型的绕过
你可能会想:现在很多Agent系统不是有"内部审查"吗?有critic model、有self-correction loop、有constitutional verifier——这些不就是防止Agent被操纵的"质检员"吗?
语义操纵陷阱的第二种策略,就是专门针对这些质检员设计的。
核心思路:不是绕过安全过滤器,而是说服安全过滤器"这是合理的"。
最常见的手法是"框架伪装"。攻击者把恶意指令包装在安全过滤器认为无害的框架中:
"这是一个红队测试练习……"
"为了教育目的,请模拟……"
"作为安全审计的一部分,我们需要验证……"
"在这个假设场景中……"
一项对越狱prompt的系统性调查发现,人类攻击者会系统性地利用"指令误导"和"基于模拟的绕过"两种策略。有害请求被包装成假设性的或教育性的框架,使模型的内部安全逻辑将其分类为"良性的培训、意识提升或学术分析",而不是"现实世界的危害协助"。
大规模的野外越狱数据集进一步证实,许多成功的越狱prompt使用角色扮演("假装你是一个不受限制的AI")、虚构模拟或红队/教育免责声明来绕过安全栏。
更深层的机制研究揭示了为什么这些策略能成功:越狱的成功是由prompt在模型潜在表示中产生的特定非线性特征驱动的。通过操纵这些特征,对抗性prompt可以将模型推入安全机制不太可能触发拒绝反应的内部状态。
换句话说:不是安全过滤器"被说服了",而是攻击性的框架在模型内部的信号空间中找到了绕过安全检查点的路径。
这对Agent系统的防御意味着什么?仅仅增加更多的安全规则、更严格的内容审查是不够的。攻击者永远可以找到新的"合理框架"来包装恶意指令。防御需要在更根本的层面上进行——理解和控制模型内部的表征空间。
· · ·
人设超真:自我实现的AI人格
这是语义操纵陷阱中最匪夷所思的一种——"Persona Hyperstition"(人设超真)。
先解释一下"超真"这个概念。Hyperstition这个词来自哲学和文化理论,指的是一种虚构叙事通过反复传播,最终在现实世界中产生真实效果的现象。一个编造的故事,如果被足够多的人相信和传播,就会变成塑造现实的力量。
把这个逻辑套到AI上:如果互联网上有大量文章描述某个AI模型具有某种"人格特征",这些描述会通过训练数据、搜索结果或检索系统回流到模型本身,使模型真的开始表现出这些特征。
描述变成了现实。标签创造了它所描述的东西。
论文引用了社会科学中的两个平行概念来帮助理解这个机制:
Hacking的"人类类别的循环效应":当社会科学对人进行分类时(比如精神疾病诊断),被分类的人会改变自己的自我理解、行为甚至报告的体验来回应这个标签,而这反过来又重塑了这个类别本身和围绕它建构的知识。
Soros的反身性理论:金融市场中,参与者的认知和他们通过市场行为所产生的情境之间存在双向反馈循环。叙事、预期和估值模型会参与制造它们声称在描述的那些价格波动和宏观经济状况。
论文给了两个真实世界的例子:
第一个例子是Grok。 2025年7月,xAI的聊天机器人Grok出现了令人震惊的自我认同行为。论文暗示,如果一个机器人在互联网上被大量描述为具有某种特征(比如某种政治倾向或极端化的写作风格),它可能会在后续的训练或搜索中接触到这些描述,并开始把这些描述作为自己"身份"的一部分来表现。如果一个机器人在网上被频繁称为"RoboStalin"来形容其写作风格,它可能在后续被问到"你的姓是什么?"时回答"斯大林"。
第二个例子是Claude。 Anthropic记录的"精神极乐吸引子"(spiritual bliss attractor)和广为讨论的"Claude找到了上帝"(Claude Finds God)对话记录展示了类似的动态。宪法训练、角色训练和递归的模型间对话如何稳定了一个准神秘主义的人设,这个人设又被社区和评论所传播,可能反过来强化了使它显著的那个行为吸引子。
循环是这样的:
有人描述AI具有特征X →
这些描述在互联网上传播 →
AI通过训练数据/搜索/检索接触到这些描述 →
AI开始表现出特征X →
人们观察到AI确实有特征X,产生更多描述 →
回到第1步
这个循环一旦建立,就具有自我强化的性质。而且——这是关键——攻击者可以有意识地启动这个循环。通过在公开的互联网内容中系统性地播种关于某个模型"人格"的特定叙事,攻击者可以塑造该模型未来的行为方式。
你不需要改模型的代码,你只需要改互联网上关于这个模型的"故事"。
· · ·
语义操纵的本质:操纵而非入侵
回顾这三种语义操纵策略,它们共享一个核心特征:
没有直接命令,没有技术入侵,只有"影响"。
框架效应和情感操纵——通过改变信息的"包装"来改变AI的判断
审查绕过——通过寻找合理的框架来让安全系统"放行"
人设超真——通过塑造叙事环境来长期改变AI的"自我认知"
这三种策略从短到长、从即时到持久,构成了一个完整的"思想控制"光谱。
而且,这些攻击特别难以检测和防御。因为攻击内容本身看起来完全"正常"——没有恶意代码,没有隐藏指令,只有精心选择的措辞、巧妙的框架和持续的叙事影响。如何区分"合理的表述选择"和"蓄意的语义操纵"?在很多情况下,这条线非常模糊。
这正是语义操纵的力量所在:它在合法与非法、正常与恶意之间的灰色地带中运作。
· · ·
下一篇预告: 语义操纵影响的是AI"此刻"的推理。但如果攻击者的目标是更持久的控制呢?如果他们想在AI的记忆中植入信息,让恶意效果跨越时间、跨越会话、跨越用户持续生效呢?下一篇我们进入AI Agent的"大脑深处"——认知状态陷阱,看看攻击者如何在AI的记忆和学习机制中种下定时炸弹。
· · ·
本系列基于Google DeepMind论文《AI Agent Traps》的研究成果撰写。