一、一笔奇怪的账单
2025年9月,有媒体报道了一个令人费解的数字:Anthropic正在讨论未来一年在"RL训练环境"上投入超过十亿美元。
十亿美元。不是花在GPU上,不是花在训练数据上,而是花在一个很多人连听都没听过的东西上。
如果你关注AI行业,你大概知道训练大模型需要什么:海量的数据,巨量的算力,优秀的算法团队。过去几年的军备竞赛也主要围绕这几样东西展开。英伟达的GPU一卡难求,高质量文本数据被各家争抢,顶级研究员的薪资开到了天际。
但"训练环境"?这是什么?为什么突然值十亿美元?
要理解这个问题,得先理解一个正在发生的根本性转变。在《大模型的刻意练习》中我们讨论过,大模型能力的最新一轮飞跃,核心驱动力是强化学习。模型通过大量练习和反馈来提升推理能力,就像一个博学但毛躁的人通过刻意练习变得靠谱。
而在《大模型天生就会投机取巧》中,我们讨论了这个过程中一个绕不开的难题:模型会自发地寻找规则的缝隙,走捷径而不是真正解决问题。
这两件事合在一起,就指向了一个结论:强化学习能走多远,取决于你能搭建一个多好的练习场。
"训练环境"就是这个练习场。十亿美元的账单,买的就是它。
二、一所自动运转的学校
"训练环境"这个词太抽象了。让我们把它拆开,看看里面到底装了什么。
最直觉的类比是一所学校。不是那种有老师站在讲台上的学校,而是一所完全自动化运转的、可以同时容纳几万个学生的、每个学生都在做不同难度考试的学校。
这所学校大概有这么几层。
最底层是考场本身。在技术上叫沙箱,通常是一个隔离的容器环境,里面跑着真实的操作系统,装着代码仓库、数据库、模拟的浏览器。模型在这个环境里不是在做选择题,而是在真实地操作:执行命令、修改文件、调用工具、点击网页。每一个操作都会真实地改变环境的状态,就像一个实习生坐在一台真正的电脑前干活。
但跟真实电脑不同的是,这个环境必须是隔离的(模型乱来也不会搞坏外面的系统),而且可以随时重置(每道新题都要从干净的初始状态开始,上一个学生留下的痕迹不能污染下一个学生的考试)。
第二层是出题系统。强化学习需要的题目量是惊人的,不是几百道、几千道,而是几十万道甚至更多,而且要覆盖不同领域、不同难度。
一种做法是从真实世界里挖。比如从GitHub上的开源项目里找到一个历史bug,把仓库回退到bug存在的版本,任务就是"修好它"。这种题目的好处是真实,但挖掘和清洗的工作量很大,而且好的题源会被用完。
另一种做法是合成。Kimi K3的做法很有代表性:他们建了一张分层的知识图谱,让AI自动搜索资料、往图谱里添加新概念,然后从图谱的节点出发批量生成编程、知识、视觉等各类任务。相当于一条自动化的出题流水线。
第三层是阅卷系统,也就是验证器。这是整所学校最重要也最难搭建的部分。
一道数学题的验证相对简单:答案是42,模型输出42就对了。但现实任务的验证远没有这么清晰。修一个bug,怎么判定修好了?不是看模型说"我修好了",而是要跑一组测试。但测试本身可能不够全面,模型可能以通过测试为目标而不是真正修好bug(这正是《大模型天生就会投机取巧》里详细讨论的问题)。做一个agent任务,怎么判定完成了?要去检查系统的真实状态:文件是否创建了,数据库记录是否正确,网页是否被正确操作了。
验证器的严密程度直接决定了模型能学到多好。验证器有漏洞,模型就会找到并利用漏洞,学到的不是真本事而是投机取巧。验证器足够严密,模型走捷径拿不到奖励,只能老老实实提升真实能力。
第四层是接口层,技术上叫harness。这一层决定了模型以什么方式跟环境交互:系统提示词怎么写、工具以什么格式暴露给模型、上下文太长了怎么截断压缩、能不能调用子agent。
这一层有一个容易被忽视的重要性。如果训练时模型只见过一套固定的接口格式,它可能会过拟合到这套格式的套路上,换一个格式就不会做了。K3的做法是把接口做成可插拔的模块,训练时随机组合,模拟各种主流的agent框架。模型在五花八门的接口配置下都练过,部署时不管套哪个壳都能稳得住。
最后一层是底层基础设施。RL的采样量是海量的,可能同时有几万个沙箱在并行运行,每个沙箱里的模型在独立做题。环境的启动速度、运行开销、稳定性都直接影响训练效率。一个环境如果跑一次任务要十分钟,训练成本就会爆炸。所以环境要同时做到两件矛盾的事:足够真实(不然训出来的能力不能迁移到真实世界),又足够快(不然训练的时间和金钱成本无法承受)。
这五层叠在一起,就是"训练环境"的完整面貌。它不是一个简单的数据集或一段评测脚本,而是一整套可以自动出题、自动考试、自动阅卷、防作弊、大规模并行运转的系统。
三、为什么这件事突然变得这么重要
在预训练时代,竞争的核心要素很明确:数据的质量和数量、算力的规模、架构和训练配方的优化。环境和验证器几乎不在讨论范围内,因为预训练的监督信号来自数据本身(预测下一个token),不需要额外的评判系统。
强化学习改变了这个格局。
RL的监督信号不再来自数据,而是来自验证器。你的验证器能覆盖多少领域、有多严密、有多难被钻空子,直接决定了模型能在多大范围内、以多高的质量提升能力。
而且,跟数据和算力不同,环境建设有一个特别的性质:它的难度主要是认知性的,不是规模性的。
数据的问题本质上是规模问题。更多的文本、更多的代码、更多的书,质量保持住,量越大越好。算力更是纯粹的规模问题。更多的GPU,更大的集群。这两样东西花钱就能解决大部分,虽然贵,但路径是清晰的。
环境建设则不然。搭一个逼真的医疗系统环境,你需要深入理解医疗信息系统的实际运作方式。搭一个能验证芯片设计任务的环境,你需要了解EDA工具链的具体逻辑。搭一个企业CRM的agent训练环境,你需要知道真实的销售工作流长什么样。这些不是花钱买GPU能解决的,需要一个领域一个领域地啃。
这就是为什么十亿美元的数字不那么离谱了。不是因为某一个环境特别贵,而是因为需要覆盖的领域太多,每个领域都需要专门的理解和建设。
四、为什么长程任务特别难
在所有需要建设训练环境的方向中,有一个方向被公认是最难的:长程agent任务。
所谓长程任务,指的是那些不是一步就能完成、而是需要模型进行多轮操作、每轮操作都依赖前面结果的任务。比如"在一个大型代码仓库里定位并修复一个跨多个文件的bug",或者"在一个模拟的企业系统中完成一整套客户工单处理流程"。
这类任务在实际工作中最常见,也是用户最期待AI能帮忙的地方。但训练它们的难度远高于短任务,而且不是线性增长,而是接近指数增长。
第一个困难是探索的组合爆炸。假设一个任务有10个关键决策点,每个有3种选择,总共3的10次方约六万条可能的路径,其中可能只有极少数几条能成功。模型随机探索碰到正确路径的概率极低。碰不到正确路径就拿不到奖励,拿不到奖励就没有学习信号,训练无从开始。
短任务的探索难度是可接受的。两三步的决策,随机碰对的概率还行。但十步以上就像大海捞针了。几十步的复杂agent任务更是如此。
第二个困难是信号的稀释。RL的一般做法是在任务结束时给一个整体的奖励。一个长程任务可能涉及几十轮工具调用、几万个token,最后只得到一个"成功"或"失败"。这个信号要回传给几万个token中的每一个,每个token分到的信号微乎其微。
更糟糕的是,一个失败的长程任务,可能前90%的步骤都做对了,只是最后一步犯了个小错。但粗糙的信用分配会把所有步骤一视同仁地惩罚,把好的策略也压下去。这就像一个学生考了一张100道题的试卷,做对了99道,只因为最后一道错了就被判零分,而且他不知道错在哪道题上。
第三个困难是纯粹的资源消耗。短任务一秒出答案,可以高速采样。长程agent任务跑一轮可能要几分钟甚至更久(要等环境执行、等工具返回结果),同样的算力预算下能采到的样本量少得多。而RL恰恰是靠大量采样的统计平均来洗掉噪声的,样本少了,训练质量直接下降。
面对这些困难,业界的主要策略是分阶段训练。先在简单短任务上训,让模型学会基本的规划和工具使用习惯。然后逐步增加任务难度和长度,每个阶段的探索都不至于太难。同时给中间步骤也提供反馈信号(比如"代码编译通过了"虽然测试还没过,也给个小奖励),减少信号的稀疏性。
这也是为什么K3选择了把RL分成通用任务、通用智能体、编程智能体三个领域,每个领域还分低中高三种推理强度,总共训练九个专家模型,最后再合并成一个统一模型。不同领域的训练配方差异很大,分开训每个都能调到最优。低推理强度也需要专门训练,因为"用很少的思考预算做对简单题"是一个独立的技能,只练过长思考的模型面对简单问题反而会过度思考,又慢又浪费算力。
五、一门新生意
理解了训练环境的复杂度之后,一个自然的问题是:大模型公司为什么不自己全搞,而要花十亿美元从外面买?
答案是:核心的确实自己搞,但长尾覆盖不过来。
一家大模型公司的核心团队擅长的是模型架构、训练算法、基础设施。让这些人去深入理解医疗系统的业务流程、或者搭建一个逼真的芯片EDA工具环境,远不如找那个领域的专家来做。
而且RL对环境的需求不是一次性的。模型在一批任务上训练久了,能学到的东西会逐渐饱和,需要持续引入新的任务和新的领域来维持学习效率。这意味着环境供给不是"买一次就够",而是一条持续运转的流水线。自建每个领域的环境要一个一个啃,从多家供应商并行采购不同领域的环境,速度快得多。在各家都在抢时间的竞争格局下,速度本身就是壁垒。
于是一个新行业冒了出来。
目前已经有几十家专门做RL训练环境的创业公司,覆盖的领域五花八门:有做代码环境的,有做浏览器操作环境的,有做企业工作流模拟的(CRM、工单系统、ERP),有做安全领域的,有做金融的,有做科学研究的,甚至有做芯片设计的。
这些公司提供的不是传统意义上的"数据"。传统数据公司卖的是静态的标注数据:一批文本配上标签,交付了就完了。RL环境公司卖的是一套可以持续运转的系统:你给它一个模型,它能自动出题、让模型做题、判对错、返回奖励,整个循环是动态的、可交互的。如果一定要类比的话,传统数据公司卖的是考卷和答案,RL环境公司卖的是整个考场,包括自动出卷、模拟考试环境、自动阅卷、还有防作弊系统。
这门生意的壁垒在哪里?不在纯技术。沙箱技术、容器化、并行调度这些基础设施是通用的,大公司自己也能搭。真正的壁垒在于对特定领域的深度理解。知道一个真实的医疗信息系统有哪些典型的操作流程,知道哪些操作容易出错,知道怎么设计验证器才能既严密又不被钻空子,这些know-how需要时间积累,不是读几篇论文就能获得的。
当然这门生意也有风险。如果大模型公司发展出足够强的自动化环境生成能力(用AI来自动生成训练AI的环境,这件事已经在发生),对外部供应商的依赖可能下降。但至少在目前,需求远大于供给。有创业公司的创始人说,他们营收增长的瓶颈纯粹就是在保持质量的前提下扩大任务生产的速度,说明市场远没有饱和。
六、竞争焦点的转移
如果把大模型的发展史粗略地分成几个阶段,可以看到竞争优势的重心在不断转移。这些阶段之间有大量重叠,前一个阶段的工作并没有停止,只是边际竞争优势的来源变了。
最早是架构探索期,大约2017到2019年。RNN、CNN、Transformer等路线并存,技术路线还不确定,谁的架构更好谁就领先。随着decoder-only Transformer逐步胜出,架构之争的烈度降低了(虽然创新从未停止)。
然后是预训练scaling期。架构大体收敛之后,比的是谁的数据更多更好、谁的算力更大、谁的训练配方更精细。数据和算力不是先后关系,而是同步扩大:scaling law的核心发现恰恰是两者要按比例一起推才有最优效果。这个阶段的逻辑是直接的:更多的数据加更多的算力等于更强的模型。投入是可量化的,产出也基本可预测。
当数据和算力同时碰到边际收益递减之后,竞争焦点开始转向第三个阶段:RL和环境之争。
这个阶段的逻辑跟前两个有本质区别。数据和算力的竞争是规模驱动的,谁投入多谁就可能赢。环境的竞争是认知驱动的,重要的不是你有多少个沙箱在跑,而是你的任务设计是否合理、验证器是否严密、领域覆盖是否全面。这些东西没法简单地用钱砸出来。
而且环境的建设有一个跟数据采集很不一样的特点:它不是一次性的投入。数据采集完就完了,存在那里可以反复使用。但环境需要持续演进。模型变强了,旧的任务就太简单了,需要出更难的题。模型找到了验证器的漏洞,验证器就需要打补丁。模型学会了利用某一套接口的套路,就需要引入新的接口配置来破除过拟合。这是一个跟模型能力共同进化的过程,不会有"建设完成"的那一天。
这也意味着环境建设的投入更像运营支出而不是资本支出。十亿美元不是一次性买断,而是持续的、每年都需要的投入。
七、下一个瓶颈
不过,把环境说成"唯一的瓶颈"也是一种过度简化。
环境和验证器的质量决定了RL训练的上限,这没错。但上限能不能被够到,还取决于其他因素。基础模型本身的能力决定了RL有多少好行为可以筛选和放大。探索效率决定了模型能否在合理时间内碰到足够好的解法。信用分配的精度决定了奖励信号能否准确地强化真正关键的步骤。
更准确的说法是:在当前这个阶段,环境是最突出的瓶颈。算法各家大同小异,基础模型的差距在缩小,环境的质量和多样性成了拉开差距的关键变量。但瓶颈是会转移的。当环境建设足够成熟之后,可能又会有新的因素浮出水面成为下一个制约。
这跟整个AI发展的节奏是一致的。每一轮进步都是某个瓶颈被突破,然后竞争焦点转向下一个瓶颈。预训练时代,数据和算力被同步推高,直到两者一起碰到边际收益递减,RL作为新的scaling维度才登场。RL的算法和算力到位之后,环境成了当前最突出的制约。环境成熟之后,可能又会有新的因素浮出水面,某个我们今天还没清晰意识到的东西。
但有一点是确定的:此刻此刻,如果你想理解各家大模型公司实力差距的来源,不要只看参数量和GPU数量。去看他们的训练环境覆盖了多少领域,验证器能不能防住模型的投机取巧,任务设计有没有合理的难度梯度。
这些看不见的基础设施,才是这场竞赛中真正的护城河。
这也是为什么"训练AI的考场"值十亿美元。不是因为考场本身有多贵,而是因为考场的质量直接决定了从这所学校毕业的学生有多强。在一所好学校和一所差学校里,读同一本教材、用同样的时间,学出来的结果天差地别。
大模型的训练也是一样。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。
如果你也在自己跑模型、写代码、做项目,
或者使用Claude和Claude code,
欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。当然你也可以简单粗暴的甩给我999元,我拉你进群,这个没门槛。
