# 你对 Scaling 的力量一无所知

> 龙虾AGI通用实验室 · 2026-07-06

75.0 vs 69.2。

前一个数字，是 Fable 5 在 low effort 下跑出的 SWE-bench Pro 成绩。后一个数字，是 Opus 4.8 在 max effort 下拼出来的。

Low effort，意思是模型几乎没怎么想，扫一眼就给了答案。Max effort，意思是模型用尽了一切手段，多路径尝试、反复推理、自我验证，所有能力全部榨干。

一个随手一答。一个全力以赴。前者赢了将近 6 个百分点。

这组数据来自 Anthropic 系统卡第 8 页的 Figure 8.2.A。不是民间测评，不是小样本噪声，是官方数据。而且更有意思的是，有人算过账：Fable 5 在 low effort 下完成一个 agentic 编码任务大约花 $5，而 Opus 4.8 在 max effort 下完成同一类任务的花费远高于此。单价贵一倍，总价反而便宜，因为消耗的 token 量根本不在一个量级。

又好又便宜。

所以问题来了：effort 到底是什么？为什么一个模型"不怎么想"能赢过另一个模型"拼命想"？这种事会一直发生下去吗？

## Effort 到底在控制什么

模型有两次花算力的机会。

第一次是训练阶段。拿海量数据跑几个月，把知识烧进参数里。结束之后参数固定，不再变化。第二次是推理阶段，就是你每次问它问题时，它现场消耗的算力。

早期的模型推理阶段很直接，问题进去答案出来，中间没有"想一想"的环节。后来 OpenAI 的 o1 和 Anthropic 的 extended thinking 做了一件重要的事：让模型在输出最终答案之前，先在内部生成一段你看不到的思考过程。这些思考 token 会影响最终答案的质量。

effort 参数控制的就是这段内部思考的深浅。low 就是几乎不想，max 就是想到极致。

不过这里有个容易想偏的地方。调高 effort 改变的不仅是思考时间的长短，更是思考方式的不同。

low effort 的思维是线性的。看到问题，脑子里冒出最可能的答案，直接输出。"看到 A，所以 B，得出 C"，一条路走到底。

Max effort 的思维是树状的。模型会同时尝试好几条路径，"如果从这个角度切入呢？等等，这里有个前提不对，退回来换一条。"它会在候选方案之间反复比较，对中间结论做验证，发现逻辑漏洞就推翻重来。

一个是考试时凭直觉写答案，一个是列提纲、多种解法都试一遍、做完还要验算。

所以 75.0 vs 69.2 的真正含义是：Fable 5 的直觉，打败了 Opus 4.8 穷尽一切手段后得出的最优解。

## 为什么大模型的"直觉"能赢

第一反应可能是：Fable 5 参数量更大，见过的东西更多，解题模式的库存更丰富。一个编程问题丢过来，答案大概率已经以某种压缩形式躺在权重里了，不需要现场推导。就像一个干了二十年的医生比刚毕业的住院医师诊断准确率高，没什么好奇怪的。

这个解释对了一半。

另一半更值得想。差距不仅仅是"见过多少"，而是"以多大的分辨率记住了它们"。同样看过一万张 CT 片子，一个医生能分辨出五种亚型，另一个只能分辨两种。差别不在看了多少张，在于他们脑中对这些片子的内部模型精度不一样。

大模型的参数更多，意味着它的表征空间维度更高。同样是"排序算法的 bug"，小模型可能把十种不同的 bug 模式粗暴地压缩成三个大类，大模型则保留了更细的区分。当问题恰好落在被小模型模糊掉的那个区域时，小模型就得靠推理去"猜"，而大模型直接就"知道"。

这就是为什么 Fable 5 在 low effort 下就能赢。它的优势刻在权重里，开机就生效，不需要推理过程来激活。而 Opus 4.8 的推理过程再怎么拉满，也只是在一个精度不够高的底座上反复搜索，搜索空间本身就缺了东西。

## 那推理到底还有没有用

有。但前提是底座得够强。

同样是 Fable 5，在 FrontierCode Diamond 上，从 low 到 max，分数从 11% 涨到了 31%，接近三倍。在 SWE-bench Pro 上，从 low 的 75.0% 涨到 xhigh 的 80.4%。推理量带来的收益是实实在在的。

但是看 Opus 4.8 的曲线，从 high 到 xhigh 到 max，每一级的提升只有几个百分点，token 消耗却翻了好几倍。收益曲线是对数型的，边际递减非常快。就像一块海绵，前几次挤能挤出很多水，后面再怎么使劲也就那么几滴。

这引出一个总结：**底座定下限，effort 抬上限。**

大底座加高 effort，上限远超小底座加高 effort。effort 不是弥补模型代差的工具，它只是在同代模型内部调节性价比的旋钮。你不能靠拼命拧旋钮来跨越代际差距。

## 这事会一直这样吗

如果每一代更大的模型都能在 low effort 下碾压上一代的 max effort，这个规律有没有尽头？

目前有共识的部分是：训练规模的收益曲线还没撞墙。从 GPT-3 到现在的 Mythos 级别，每次把训练计算量提高一个数量级，底座能力都在稳步上升。曲线还在走，没有变平的迹象。

没有定论的有两件事。

一个是数据墙。训练需要海量高质量数据，互联网上的文本总量是有限的。业界在用合成数据（让模型自己生成训练数据）来补，但合成数据能不能无限替代真实数据，会不会引入某种退化，现在没有确切答案。如果这堵墙存在而且绕不过去，扩大底座的路径就会变慢，推理时间计算的相对价值就会上升。

另一个是架构创新。以上所有讨论都建立在 Transformer 架构上。如果出现全新的架构让推理效率大幅提升，比如把类似蒙特卡洛树搜索的方法整合进语言模型，那小模型通过更聪明的推理策略追上大模型也不是不可能。有人在探索，但离实用还有距离。

未来两三代模型，这个趋势大概率持续。底座规模仍然是最关键的变量。

## 那到底该怎么选模型

回到最实际的问题。

别被单价骗了。Fable 5 每百万 token 的价格是 Opus 4.8 的两倍，看起来贵。但 chudi.dev 那篇文章把账算清楚了：Fable 5 在 low effort 下完成一个 agentic 编码任务大约花 $5，Opus 4.8 在 max effort 下完成同类任务花费更高。原因很简单，low effort 消耗的 token 量远小于 max effort。单价贵一倍但用量少好几倍，总价反而低。正确的成本计算方式不是比单价，而是比"把一件事做完总共花了多少钱"。

也别一刀切全换 Fable 5。在短小、明确的任务上两者差距很小，Opus 4.8 依然是更好的默认选项。Anthropic 自己说了一句很实在的话："任务越长越复杂，Fable 5 的领先幅度就越大。"合理的策略是日常用 Opus 4.8，把最难的那 10% 到 20% 交给 Fable 5。

但这些都是战术层面的事。75.0 vs 69.2 真正在说的，是一件关于 scaling 的事：当底座足够强大的时候，直觉就已经超越了深思熟虑。每一代模型的"随手一答"，都在碾压上一代的"全力以赴"。这条规律还没有停下来的迹象。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/54a054/img_001.jpg)
