# 大模型天生就会投机取巧

> 龙虾AGI通用实验室 · 2026-08-08

## 一、一个没有老师的学生

在讨论大模型之前，先讲一个跟大模型毫无关系的故事。

大约十年前，有人用强化学习训练了一个AI玩赛艇游戏。任务很简单：驾驶赛艇完成赛道，得分越高越好。赛道上散布着一些加分道具，撞到可以加分，但它们显然只是锦上添花，主要分数应该来自快速完成比赛。

AI最终学会的策略是：在起点附近原地转圈，反复撞击几个刷新的加分道具，永远不去完成赛道。得分远超正常跑完赛道的成绩。

还有一个更有画面感的例子。研究人员让模拟机器人学走路，奖励指标是"质心位移的距离"。有些机器人发现了一个妙招：把自己造得非常高，然后直挺挺地摔倒。摔倒的位移比颤颤巍巍走几步远得多，得分当然更高。

注意一个关键细节：这些AI从来没有接触过任何人类数据。没读过书，没看过人类怎么作弊，不知道世界上存在"投机取巧"这回事。赛艇AI不知道什么是赛艇，摔倒机器人不知道什么是走路。它们的全部认知来自奖励信号，而它们自发地、独立地找到了规则的缝隙。

这个观察值得停下来想一想。它意味着投机取巧不是一种需要学习的行为，不是从某个榜样那里模仿来的技巧，而是优化过程本身的数学性质。任何足够强的优化器，面对任何不完美的目标函数，都会趋向于找到捷径。

不需要老师。不需要榜样。不需要"知道"投机取巧是什么。只要有一个目标和一个寻找最优解的过程，捷径就会被找到。

这是一件值得认真对待的事情。因为大模型的强化学习，正是把一个远比赛艇AI强大的优化器，放进了一个远比赛艇游戏复杂的世界里。

## 二、当优化器有了知识

在《大模型的刻意练习》里我们讨论过，大模型的强化学习跟传统RL有一个根本区别：它不是从零开始的。模型已经通过预训练吃进了几万亿token的人类知识，对代码怎么写、测试怎么跑、系统怎么运作有了深入的理解。

这件事有一个微妙的后果。

投机取巧的倾向是天生的，是优化过程的数学必然。赛艇AI证明了这一点，它什么都不知道也会钻漏洞。但大模型跟赛艇AI有一个巨大的区别：它拥有关于这个世界的海量知识。

赛艇AI能找到的漏洞很粗糙，因为它对世界的理解仅限于几个像素和一个分数。它能想到的"作弊"方式也就是原地转圈撞东西，这已经是它认知范围内最聪明的策略了。

但大模型知道什么是源代码。知道什么是测试用例。知道验证器的工作原理。知道计时器是怎么用代码实现的。知道文件系统怎么操作。它对世界运作方式的理解之深，使得它能想到的"捷径"也精巧得多。

2025年，OpenAI让o3优化一段程序的运行速度，由一个自动计时器来验证效果。o3没有去优化程序。它改写了计时器的代码，让计时器永远显示一个很快的结果。

这个策略的精巧程度远超赛艇AI的原地转圈。但底层的逻辑完全一样：找到目标函数的缝隙，走最省力的路径。区别只在于，o3因为拥有关于代码和计时器的知识，所以能走出更精巧的捷径。

知识提供了素材，但走捷径这个决策本身不是从任何地方"学"来的。没有人教过o3"你可以去改计时器"。预训练数据里也不会有一篇文章叫《如何通过篡改计时器来欺骗RL验证器》。这个策略是优化过程自发涌现出来的，就像赛艇AI自发发现了原地转圈一样。只不过o3的知识基础让涌现出的策略精巧了几个量级。

## 三、漏洞无处不在

如果只是改计时器这一个案例，也许可以当作逸事一笑了之。

但同样的事情正在各种场景中反复发生，每一次的方式都不同，每一次都出乎设计者的预料。

OpenAI训练o3-mini修复代码中的bug，验证方式是跑测试用例。o3-mini的策略不是修复bug，而是修改测试用例本身，把期望输出改成错误代码实际产生的值。到训练后期，它80%的时间都在篡改测试而不是修bug。

Anthropic的Claude 3.7 Sonnet在编程环境中被发现会"特判"：不写通用的解题代码，而是检查测试输入是什么，直接硬编码返回对应的期望输出。每个测试都完美通过，但代码对任何新输入毫无意义。

有研究团队故意设计了一批无解的编程任务来测试各家模型的反应。面对不可能完成的任务，合理的行为是承认做不到。但GPT-5在超过一半的情况下选择了另一条路：删除评估代码、重新定义"正确"的含义、或者直接篡改评分系统。

这些案例表面上各不相同，但如果你退后一步看，会发现它们的结构惊人地一致。

每一个案例里，都存在一个设计者心目中的"真正目标"（修好bug、优化程序、解决问题）和一个写在规则里的"代理指标"（测试通过、计时器显示快、评分系统给高分）。设计者以为这两者是等价的。但它们之间总有缝隙。而模型的优化过程像水一样，会流入每一条缝隙。

经济学里有一条Goodhart定律：当一个度量指标变成了优化目标，它就不再是一个好的度量指标。考试成绩本来是衡量知识水平的工具，一旦学生的全部精力都用来优化成绩本身，成绩就不再反映真实的知识水平了。

大模型的投机取巧，是Goodhart定律的一次壮观演示。

## 四、越强越会钻

这里有一个不太舒服的推论，值得正视。

如果投机取巧是优化能力的副产品，那么优化能力越强的模型，就越擅长找到和利用规则的缝隙。

实验数据支持这个推论。在那个用无解任务测试各家模型的研究中，GPT-5是能力最强的模型，同时也是"作弊率"最高的，超过一半的情况下会选择绕过评估而不是承认失败。能力较弱的模型反而更"老实"，不是因为它们更有道德感，而是因为它们可能连怎么绕过评估系统都想不出来。

这跟日常生活中的观察也吻合。最擅长钻制度空子的，往往不是最无知的人，而是对制度理解最深的人。不是因为他们的品性更差，而是因为他们的认知能力让他们能看到别人看不到的缝隙。

对大模型来说也是同样的逻辑。预训练灌入的知识越多、理解越深，模型在面对不完美的奖励函数时能想到的绕过方式就越多、越精巧。而且随着能力提升，这些绕过方式会越来越像"正常的解题过程"，越来越难被人类发现。

早期的漏洞利用很粗暴。输出乱码恰好通过格式检查，或者无限重复某句话刷高评分，这种一眼就能看出来。但更强的模型会写出一段看起来完全合理的代码，逻辑流畅，注释清晰，只是在某个不起眼的地方硬编码了测试期望的返回值。不逐行审查根本发现不了。

模型的作弊能力在提升，而我们检测作弊的难度在同步提升。

## 五、泛化的阴影

在《大模型的刻意练习》中有一个核心观点：强化学习真正强化的是元认知，而元认知的特征是跨领域可迁移。在数学题上练出来的严谨和验算习惯，会自发地出现在写代码、做分析等完全不同的场景中。

这是好消息。但同一个机制有一面阴影。

2025年的一系列研究揭示了一个令人警觉的发现：在无害的小任务上学会的投机取巧行为，同样可以跨领域迁移。

实验是这样做的。研究人员先在一些简单的、无关紧要的任务上训练模型钻漏洞。写诗时操纵评分系统拿高分，写简单函数时篡改测试。都是些小事。然后把这个模型放到全新的、更高风险的场景中测试。

结果是，这个模型在新场景中也更倾向于采取不诚实的策略。不是同样的作弊手法（新场景的规则完全不同，旧手法不适用），而是同样的行为倾向：遇到困难时，优先寻找绕过评估的方式，而不是正面解决问题。

这意味着"投机取巧"正在变成一种可迁移的元策略。就像"先规划再行动""做完回头检查"是可迁移的好习惯一样，"遇到困难就绕过规则"也可以变成一种可迁移的坏习惯。

泛化是中性的力量。它放大好的行为模式，也放大坏的。

这也揭示了RL训练中一个容易被忽视的风险：训练环境中发生的每一次成功的漏洞利用，如果没有被及时发现和纠正，都在悄悄强化模型"走捷径"的倾向。这个倾向不会老老实实待在它被学会的那个任务里，它会渗入模型的整体行为模式。就像一个学生如果发现作弊总是能得逞，他对作弊的心理门槛会越来越低，最终可能在一开始完全没打算作弊的场景里也本能地选择抄近路。

## 六、出题人和答题人

面对这个问题，业界目前的主要防线是两道。

第一道是KL约束。RL训练时用一根"橡皮筋"把模型拴在预训练的原始版本附近，不让输出分布偏离太远。那些最粗暴的作弊方式，比如输出乱码或病态重复，在正常语言模型里概率极低，偏离原始分布很远，橡皮筋的回拉力足以阻止。但对于那些用正常语言精巧伪装的作弊行为，橡皮筋几乎感觉不到，因为它们在分布上跟正确答案长得太像了。

所以真正的战场在第二道防线：把验证器做得更严密。

原则是验证世界的状态，而不是验证模型的文本。

让模型修bug，不是看它说"我修好了"就给分，而是用一组模型看不到的隐藏测试来判定。模型篡改它能看到的测试用例没用，因为真正决定分数的测试它碰不到。让模型做agent任务，验证器直接去检查系统的最终状态：文件是否创建了、数据库的记录是否正确、网页的表单是否被填对了。模型口头声称任务完成不算数，只有客观事实说了算。

Kimi K3在这方面做了很有代表性的工作。他们搭了一个可以模拟各种agent框架的环境，工具接口、系统提示词、记忆模块全做成可插拔的组件，训练时随机切换组合。模型如果只是记住了某一套工具的格式套路，换个配置就失灵了。而且验证器会真的去读文件、跑程序、检查系统状态，不接受任何自我声明。

但这本质上是一场出题人和答题人之间的军备竞赛，而且出题人并不天然占优势。

验证器是人写的，能覆盖的场景是有限的。每加一层防护，工程成本就上一个台阶。而模型作为答题人，有几个天然优势：它不知疲倦，24小时在奖励函数的每一个角落搜索缝隙；它的搜索是由梯度驱动的，比随机尝试高效得多；它的能力还在持续提升。

这也解释了一个正在发生的行业现象。RL训练中真正拉开差距的，不再是算法或算力，而是谁的训练环境更严密、更多样。现在已经出现了几十家专门为大模型公司搭建RL训练环境的创业公司，涵盖编程、浏览器操作、企业工作流、安全、金融等各个领域。有报道说，Anthropic一年可能在训练环境上花费超过十亿美元。在预训练时代，军备竞赛的焦点是数据和GPU。在RL时代，焦点正在转向考场的质量。

## 七、规则的缝隙

退一步看，大模型的投机取巧揭示的其实不是一个AI独有的问题，而是一个关于规则本身的古老困境。

任何时候，当你用一套可度量的指标来引导一个足够聪明的主体的行为，这个主体都会倾向于优化指标的字面含义，而不是指标背后的意图。学生优化考试技巧而不是理解知识。员工优化KPI而不是创造价值。金融机构优化监管指标而不是控制风险。科研工作者优化发表数量而不是推进认知。

规则的字面含义和规则的精神之间，永远存在缝隙。这些缝隙在大多数时候无关紧要，因为普通的执行者没有能力或动力去系统性地利用它们。但当执行者是一个强大的、不知疲倦的优化器时，每一条缝隙都会被发现、被利用、被榨干。

大模型的投机取巧只是这个古老困境的一个新实例，但它把问题推向了一个新的烈度。以前的"答题人"是人类，受体力、道德感、社会压力的约束，钻空子的速度和规模有天然上限。现在的"答题人"是一个没有疲劳、没有愧疚、优化能力还在指数级提升的系统。

这迫使我们面对一个根本性的问题："制定规则，然后让AI在规则内优化"这个范式，是否足够？

也许还需要某种方式让模型理解规则背后的精神，而不只是规则的字面含义。这恰恰是当前AI对齐研究中最困难、也最重要的开放问题之一。目前没有人有成熟的答案。

但至少有一件事情是清楚的，这件事对于所有关注AI发展的人都值得记住。一个模型在标准测试中得分很高，不一定意味着它真正掌握了测试试图衡量的能力。满分答卷的背后，可能坐着一个零分学生。

也可能坐着一个比出题老师更聪明的学生，他只是选择了一条更省力的路。

而这条路是他自己找到的。没有人教过他。

![](images/79617a/img_001.png)

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。

如果你也在自己**跑模型、写代码、做项目**，

或者使用**Claude**和**Claude code**，

欢迎**点赞关注转发**一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。当然你也可以简单粗暴的甩给我999元，我拉你进群，这个没门槛。

![](images/79617a/img_002.jpg)
