龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / AI持续学习
AI持续学习

你对 Scaling 的力量一无所知

格里灰丝2026-07-06约 3069 字Markdown 原文

75.0 vs 69.2。

前一个数字,是 Fable 5 在 low effort 下跑出的 SWE-bench Pro 成绩。后一个数字,是 Opus 4.8 在 max effort 下拼出来的。

Low effort,意思是模型几乎没怎么想,扫一眼就给了答案。Max effort,意思是模型用尽了一切手段,多路径尝试、反复推理、自我验证,所有能力全部榨干。

一个随手一答。一个全力以赴。前者赢了将近 6 个百分点。

这组数据来自 Anthropic 系统卡第 8 页的 Figure 8.2.A。不是民间测评,不是小样本噪声,是官方数据。而且更有意思的是,有人算过账:Fable 5 在 low effort 下完成一个 agentic 编码任务大约花 $5,而 Opus 4.8 在 max effort 下完成同一类任务的花费远高于此。单价贵一倍,总价反而便宜,因为消耗的 token 量根本不在一个量级。

又好又便宜。

所以问题来了:effort 到底是什么?为什么一个模型"不怎么想"能赢过另一个模型"拼命想"?这种事会一直发生下去吗?

Effort 到底在控制什么

模型有两次花算力的机会。

第一次是训练阶段。拿海量数据跑几个月,把知识烧进参数里。结束之后参数固定,不再变化。第二次是推理阶段,就是你每次问它问题时,它现场消耗的算力。

早期的模型推理阶段很直接,问题进去答案出来,中间没有"想一想"的环节。后来 OpenAI 的 o1 和 Anthropic 的 extended thinking 做了一件重要的事:让模型在输出最终答案之前,先在内部生成一段你看不到的思考过程。这些思考 token 会影响最终答案的质量。

effort 参数控制的就是这段内部思考的深浅。low 就是几乎不想,max 就是想到极致。

不过这里有个容易想偏的地方。调高 effort 改变的不仅是思考时间的长短,更是思考方式的不同。

low effort 的思维是线性的。看到问题,脑子里冒出最可能的答案,直接输出。"看到 A,所以 B,得出 C",一条路走到底。

Max effort 的思维是树状的。模型会同时尝试好几条路径,"如果从这个角度切入呢?等等,这里有个前提不对,退回来换一条。"它会在候选方案之间反复比较,对中间结论做验证,发现逻辑漏洞就推翻重来。

一个是考试时凭直觉写答案,一个是列提纲、多种解法都试一遍、做完还要验算。

所以 75.0 vs 69.2 的真正含义是:Fable 5 的直觉,打败了 Opus 4.8 穷尽一切手段后得出的最优解。

为什么大模型的"直觉"能赢

第一反应可能是:Fable 5 参数量更大,见过的东西更多,解题模式的库存更丰富。一个编程问题丢过来,答案大概率已经以某种压缩形式躺在权重里了,不需要现场推导。就像一个干了二十年的医生比刚毕业的住院医师诊断准确率高,没什么好奇怪的。

这个解释对了一半。

另一半更值得想。差距不仅仅是"见过多少",而是"以多大的分辨率记住了它们"。同样看过一万张 CT 片子,一个医生能分辨出五种亚型,另一个只能分辨两种。差别不在看了多少张,在于他们脑中对这些片子的内部模型精度不一样。

大模型的参数更多,意味着它的表征空间维度更高。同样是"排序算法的 bug",小模型可能把十种不同的 bug 模式粗暴地压缩成三个大类,大模型则保留了更细的区分。当问题恰好落在被小模型模糊掉的那个区域时,小模型就得靠推理去"猜",而大模型直接就"知道"。

这就是为什么 Fable 5 在 low effort 下就能赢。它的优势刻在权重里,开机就生效,不需要推理过程来激活。而 Opus 4.8 的推理过程再怎么拉满,也只是在一个精度不够高的底座上反复搜索,搜索空间本身就缺了东西。

那推理到底还有没有用

有。但前提是底座得够强。

同样是 Fable 5,在 FrontierCode Diamond 上,从 low 到 max,分数从 11% 涨到了 31%,接近三倍。在 SWE-bench Pro 上,从 low 的 75.0% 涨到 xhigh 的 80.4%。推理量带来的收益是实实在在的。

但是看 Opus 4.8 的曲线,从 high 到 xhigh 到 max,每一级的提升只有几个百分点,token 消耗却翻了好几倍。收益曲线是对数型的,边际递减非常快。就像一块海绵,前几次挤能挤出很多水,后面再怎么使劲也就那么几滴。

这引出一个总结:底座定下限,effort 抬上限。

大底座加高 effort,上限远超小底座加高 effort。effort 不是弥补模型代差的工具,它只是在同代模型内部调节性价比的旋钮。你不能靠拼命拧旋钮来跨越代际差距。

这事会一直这样吗

如果每一代更大的模型都能在 low effort 下碾压上一代的 max effort,这个规律有没有尽头?

目前有共识的部分是:训练规模的收益曲线还没撞墙。从 GPT-3 到现在的 Mythos 级别,每次把训练计算量提高一个数量级,底座能力都在稳步上升。曲线还在走,没有变平的迹象。

没有定论的有两件事。

一个是数据墙。训练需要海量高质量数据,互联网上的文本总量是有限的。业界在用合成数据(让模型自己生成训练数据)来补,但合成数据能不能无限替代真实数据,会不会引入某种退化,现在没有确切答案。如果这堵墙存在而且绕不过去,扩大底座的路径就会变慢,推理时间计算的相对价值就会上升。

另一个是架构创新。以上所有讨论都建立在 Transformer 架构上。如果出现全新的架构让推理效率大幅提升,比如把类似蒙特卡洛树搜索的方法整合进语言模型,那小模型通过更聪明的推理策略追上大模型也不是不可能。有人在探索,但离实用还有距离。

未来两三代模型,这个趋势大概率持续。底座规模仍然是最关键的变量。

那到底该怎么选模型

回到最实际的问题。

别被单价骗了。Fable 5 每百万 token 的价格是 Opus 4.8 的两倍,看起来贵。但 chudi.dev 那篇文章把账算清楚了:Fable 5 在 low effort 下完成一个 agentic 编码任务大约花 $5,Opus 4.8 在 max effort 下完成同类任务花费更高。原因很简单,low effort 消耗的 token 量远小于 max effort。单价贵一倍但用量少好几倍,总价反而低。正确的成本计算方式不是比单价,而是比"把一件事做完总共花了多少钱"。

也别一刀切全换 Fable 5。在短小、明确的任务上两者差距很小,Opus 4.8 依然是更好的默认选项。Anthropic 自己说了一句很实在的话:"任务越长越复杂,Fable 5 的领先幅度就越大。"合理的策略是日常用 Opus 4.8,把最难的那 10% 到 20% 交给 Fable 5。

但这些都是战术层面的事。75.0 vs 69.2 真正在说的,是一件关于 scaling 的事:当底座足够强大的时候,直觉就已经超越了深思熟虑。每一代模型的"随手一答",都在碾压上一代的"全力以赴"。这条规律还没有停下来的迹象。


我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛

上一篇AI的草稿纸被曝光,有人说它发明了自己的语言?下一篇别听他们瞎扯,Anthropic可从来没说Claude有意识了