# AI Agent的路径，本质是自己发现的还是人类预设的？

> 龙虾AGI通用实验室 · 2026-06-23

## 引子

如果你正在开发AI Agent，或者正在评估要不要把业务流程交给AI来做，你大概率被一个问题困扰过：

AI Agent看起来能自主决策，但这个"自主"是真的吗？

它遇到一个问题，能从多条路中选一条走。但这些路到底是人预先铺好让它挑的，还是它自己发现的？

这个问题不是哲学空谈。它直接决定了一个工程决策：开发Agent的时候，我到底需不需要先把所有可能的情况都替它想好？如果每条路都是人设计的，那我必须穷举；如果路真的是AI自己构造的，那我的工作重心就完全不同了。

答案是后者。但要把它想透，需要先做一个区分。

## 一、先分清楚：你说的"Agent"是哪一种

市面上被叫做"Agent"的东西其实是两类，它们在自主性上有根本差异。

**第一类：工作流式Agent。** 用Dify、Coze这类平台搭出来的典型产物。开发者用代码或画布定义好节点和分支，大模型只在节点内部干活：写一段文案、做一次分类、提取一些信息。遇到分叉，走哪条路是设计阶段就决定好的条件判断。

这类"Agent"的每条路都是人铺的。AI只是在人设计的离散选项中选了一个。严格来说，这不叫自主决策，叫条件分发。

**第二类：Agentic Loop（智能体循环）。** 比如Claude Code、Manus这类智能体。开发者只提供目标、工具和边界，然后启动一个循环：模型观察当前状态，自己决定下一步做什么，执行，看结果，再决定下一步。循环本身是开放的，没有人画过流程图，没有人写过"遇到A就做B"的分支。

这两类东西被混着叫"Agent"，导致关于自主性的讨论从根上就是混乱的。后面的讨论只针对第二类。

## 二、Agentic Loop在修路，不是在选路

Agentic Loop的核心代码结构极其简单：

whileTrue:    观察当前状态    思考并决定下一步行动    如果行动是调用工具 → 执行 → 把结果喂回去 → 继续循环    如果行动是最终回复 → 结束

注意这里没有任何if/else分支，没有场景枚举，没有预设路径。模型输出的是自由文本，它可能决定"先读一下这个文件看看结构"，也可能决定"先检查输入数据的格式是否合规"。每一步决策都是从概率分布中逐token生成的，可能的输出空间大到没有任何人枚举过。

当它面对一个没人见过的问题时，那条解决路线不在任何开发者写的清单里。它是当场构造出来的。

这不是类比，是字面意义上的描述：模型在运行时，实时生成了一条从未被任何人规划过的行动序列。

但这立刻引出一个更深的问题：路是AI修的，但AI走的那片"大地"不还是人造的吗？模型的全部能力来自训练数据和训练过程，它走不出训练分布张成的那个空间。在这个意义上，大地确实是人造的。

那么，"在人造的大地上自己修路"和"在人铺好的公路上选路口"，有本质区别吗？

有。而且是类型上的区别，不是程度上的区别。

**第一个论证：国际象棋。** 国际象棋的规则完全是人写的，只有几页纸。但由这几页规则生成的棋局树，大到宇宙中的原子数都不够枚举。没有人会说一位棋手是"从规则里挑了一盘预先写好的棋"。生成规则和枚举结果是根本不同的两件事。工作流是枚举结果，每个分支都对应开发者设想过的一种情况。Agentic Loop是生成规则，训练赋予模型一套行为规则，由这套规则在运行时生成具体路径。规则的作者从未见过、也不可能见过这些具体路径。

**第二个论证：决策时刻。** 工作流的决策在设计时做出。做决策的开发者看不见未来每个具体案例的细节，只能靠预判。Agentic Loop的决策在运行时做出。做决策的系统正盯着眼前这个案例的全部信息，包括那些开发者不可能预见的细节。这是成文法和法官的区别。法官也是法律传统的产物，但没有人说法官等于法条。法条是死的，法官面对每个案件时的判断是活的。

**第三个论证：人类专家。** 如果"在人造的空间里选路径"就算"预设"，那一位资深工程师也是"预设"的，他大脑里的能力空间完全由教育、师傅和过往案例塑造，他的判断同样是在学到的先验里做组合。可我们清楚地感觉到，照SOP逐条执行的新人和凭判断力随机应变的老工程师，有质的区别。把后者也归入"预设"的定义，已经失去了区分能力，说明"空间是谁造的"不是那个关键问题。关键问题始终是：面对一个具体情境，行动路径是事先被某个人想过的，还是当场生成的。

所以结论是：**Agentic Loop中的AI确实在自主构造路径，而不是从预设选项中挑选。它的构造能力有边界（走不出训练分布），但在边界内，它的行为是生成式的、运行时的、针对当前情境的。**

这个结论对开发者的含义非常直接：**你不需要穷举所有情况。** 模型真的能为你没预料到的情况构造新路径。但路径质量取决于你的领域在模型训练分布里的覆盖程度：通用编程、日常文书，覆盖充分，放手即可；专业垂直领域，覆盖可能很薄，这才是你需要介入的地方。

## 三、如果AI能自己想，开发者该做什么

既然AI能自主决策，开发者的工作就从"替它规划路径"变成了"给它建设工作环境"。

这听起来像是"那就什么都不用做了"，但实际上，建设工作环境的质量直接决定了Agent的表现上限。

一个好的类比是实验室主任。好的实验室主任不需要替博士后设计每一步实验，但需要确保实验室里有合适的仪器、试剂充足、安全规范到位、出了问题有排查机制。博士后的聪明才智是他自己的，但发挥的程度取决于主任建设的环境。

具体来说，开发者建设的环境包含四样东西。

**第一，工具。** 大模型是一个有能力但没有手的大脑。你给它的工具就是它的手。能读文件、能写文件、能调用计算程序、能查数据库、能搜索信息，这些能力不是模型自带的，是你通过工具赋予的。工具的质量极端重要：接口描述是否清晰（模型要能读懂每个工具是干什么的）、返回格式是否好解析、错误信息是否有意义。一套好用的工具，比一个精巧的框架重要得多。

**第二，知识。** 这是很多人会误解的地方。给模型注入领域知识，行业规则、术语定义、规范条文、历史范本，很多人直觉上觉得这是在"约束"它。不是。这是在给它信息。医生的医学知识没有降低医生的智能，恰恰是智能发挥的前提。一个什么都不知道的AI，面对专业问题只能瞎猜。知识注入提高的是它的有效智能。

**第三，边界。** "不许碰生产数据库""单次运行成本不超过多少""遇到不确定的情况停下来问人"。这类约束限制的是底线，不限制过程。模型在边界内怎么走都行。这同样不损失智能，反而是你敢放权的前提，没有围栏的悬崖边，你不敢让任何人走近。

**第四，反馈。** 这是最容易被忽略、也是最重要的一样。过程不规定了，靠什么保证质量？靠让错误被发现。编程Agent效果好，根本原因是环境自带反馈：编译报错了、测试没过、程序跑不起来，模型自己就能看见错误并纠正。如果你的领域没有这种天然反馈，你要做的就是人工构建它，校验器检查结果是否合规、另一个模型扮演审查者逐条检查、异常值检测发现偏差。反馈环路替代了过程规定：不是不让你错，而是错了能发现、能纠正。

**真正会降低AI智能的只有一样东西：过程规定。** "必须先做A，再做B，再做C""遇到X情况必须走Y分支"。你替它规定了路径，它就没机会构造更好的路径了。你对情况的预判封住了它运行时判断力的上限。

所以开发者该做和不该做的事情有了清晰的分界线：工具要造好，知识要给够，边界要画清，反馈要建起来。路径不要管。

## 四、行业正在发生什么：大模型正在学习使用工具

以上所有讨论基于一个现状：模型已经具备了一定程度的自主决策能力。但这个能力是怎么来的，以及它正在怎么变强，值得单独说。

早期的模型学会使用工具靠的是监督微调：人写好一批"遇到这种问题就调这个工具"的示范数据，模型照着学。这就像背棋谱，能处理见过的局面，没见过的就容易出错。

现在行业正在发生的转变叫Agentic RL（智能体强化学习）。做法是让模型在真实的工具环境中反复试错，调对了拿奖励，调错了受惩罚，通过强化学习优化工具调用策略。从背棋谱变成下真棋。

这不是实验室里的概念验证，而是头部实验室真金白银在投入的方向。Anthropic目前是编程和计算机操作类RL训练环境的最大采购方，每年在这上面的花费达数千万美元量级，且在快速增长。OpenAI在开发"通用验证器"，目标是把这种训练扩展到数学和代码之外的领域。开源社区也有Agent-R1、MARTI（ICLR 2026接收）、VerlTool等框架在推进。

这里有一个开发者最关心的问题：**如果模型是和特定工具环境一起训练的，换了框架或工具，训练出来的能力还有用吗？**

答案是：有用。因为模型在Agentic RL中学到的不是"怎么调某个具体API"这种表层操作，而是一组元能力：什么时候该停下来想、什么时候该调工具、工具报错了该怎么调整策略、多步计划怎么拆分。这些元能力面对新的工具同样有效。2026年5月发布的Qwen 3.7-Max专门验证了这一点：无论通过Claude Code、OpenClaw还是自定义框架调用，表现保持一致。早期模型确实存在跨框架性能下降的问题，但新一代模型已经在有意识地解决它。

类比驾校学车：驾校教会你的不是"这辆教练车的油门踩多深"，而是判断路况、预判风险、处理突发情况的通用能力。换一辆车前几分钟可能不顺手，但很快就适应了。

这对开发者有两重含义。

**第一，选模型和选框架是独立决策。** 不需要因为用了某个框架就绑定某个模型。选模型看综合能力，选框架看工程成熟度，两件事分开考虑。Agent框架做的事情，上下文管理、错误恢复、成本控制、安全拦截，全是工程问题，不是智能问题。它不决定AI有多聪明，但决定这个聪明劲儿你能稳定用到多少。

**第二，你为今天的模型搭的脚手架，可能成为明天模型的天花板。** 现在为弥补模型能力不足而写的工程代码（重试逻辑、格式修正、错误恢复），未来版本的模型可能根本不需要。所以这些辅助代码最好设计成随时可拆的，不要让它变成核心依赖。

而真正不会过时的是什么？是你封装的专业工具、积累的领域知识库、沉淀的审查清单。这些东西和模型代际更替无关，反而随着使用越积越厚。模型在变强，框架在迭代，但你那个行业里"什么算对、什么算好、哪里容易踩坑"的知识，只有你有。

## 结语

回到开头那个问题。

AI Agent到底能不能自己想？能。它在运行时自主构造路径，不是从预设选项中挑选。它的能力有边界，走不出训练分布的范围，但在边界内，它的行为是真正生成式的。

这个结论改变了开发者的工作定义。你不是在替AI规划路线的建筑师，你是在为它建设工作环境的实验室主任。工具造好，知识给够，边界画清，反馈建起来，然后放手让它走。它会走出你没想过的路。

行业的趋势还在强化这个方向：模型正在通过强化学习变得越来越擅长自主使用工具，和具体框架不绑定，元能力越来越通用。这意味着开发者的真正壁垒不在工程架构上，那些东西人人都能搭，而且模型变强后很多会变得多余。壁垒在于你的领域里那些不可替代的东西：专业工具、行业知识、从实践中沉淀出来的判断标准。

框架会过时，模型会迭代，工程代码会重写。

只有领域知识越积越厚。把精力花在那里。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/538a8c/img_001.jpg)
