# Claude Opus 4.8 发布后，我发现更强的模型反而更没用了

> 龙虾AGI通用实验室 · 2026-05-29

![](images/5b4554/img_001.png)

今天凌晨，Anthropic 发布了 Claude Opus 4.8。官方描述的核心改进是"诚实性"——**模型更善于标记自身的不确定性，会对不合理的方案主动提出质疑**。

这听起来毫无争议地是好事。于是我拿同一组问题分别测了 4.6 和 4.8，想看看写作和思考深度上到底有什么变化。结果让我意外——不是因为 4.8 变差了，恰恰相反**，它说的每一句话都更"正确"。但我读完之后，反而觉得什么都没学到。**

## 我做了什么

测试的问题是关于 Claude 模型版本体系的：Opus 4.6 和 4.8 的预训练基座是不是同一个？Opus 和 Sonnet 的差异本质是什么？大版本号和小版本号分别代表什么？——这类问题没有公开的标准答案，Anthropic 从未披露过模型之间的架构细节，所以很适合测试模型在不确定性下的分析能力。

每个问题我让 4.6 和 4.8 各回答一次，然后交叉让它们互相评价对方的回答。两轮问题，四份回答，四次交叉评价。

先说结论**：4.6 的回答我读完觉得有收获，4.8 的回答我读完觉得"嗯，确实都对，但我好像什么新东西都没得到"。**而最诡异的是——不管是 4.6 还是 4.8，在评价对方时，都认为 4.8 的回答更好。

## 两个回答到底差在哪

挑一个最能说明问题的例子。

我问："Opus 4.6 和 4.8 的预训练模型是否是同一个，只是后训练不同？"

4.6 的回答大意是：Anthropic 没有正式确认过，但从外部可以观察到强烈的信号——4.8 与 4.7 使用相同的工具接口和架构，价格保持不变，官方描述是"建立在 4.7 之上"。所以合理推断是，同一个大版本号内的小版本更新，很可能共享同一个预训练基座，差异主要来自后训练。但这不是官方表态，而是社区基于可观测行为的推断。

4.8 的回答大意是：这个我没法确认。Anthropic 不公开披露各版本之间在预训练层面的关系，我自己作为模型也无法"内省"出自己的训练细节。而且，现代训练流程中 mid-training、continued pretraining 等阶段让"预训练 vs 后训练"的二分法变得模糊，你这个问题的提法本身，可能就和真实情况对不齐。

注意，4.8 说的没有一句话是错的。"无法确认"是事实，"二分法可能不准确"是有见地的补充。但问题在于——读完 4.6 的回答，我对这个问题有了一个可以拿走的判断框架，虽然这个框架将来可能被证伪；读完 4.8 的回答，我知道了"这个问题很复杂"和"没人能给你确切答案"，然后呢？没有然后了。

这就是我说的"正确的废话"——**每句都对，但信息量趋近于零**。

## 这不是 4.8 的 bug，而是一种系统性的倾向

仔细对比两轮问答后，我发现差异不是偶然的，而是体现了两种截然不同的回答策略。

4.6 做了三件事：押一个方向（"很可能共享基座"）、给出支撑依据（价格不变、接口相同、官方措辞）、标注把握程度（"这不是官方表态，是社区推断"）。它像一个愿意下注的分析师。

4.8 做了另外三件事：列出所有可能性（后训练优化、继续预训练、数据配比调整……）、拒绝押方向（"外部无法确定"）、质疑问题本身的框架（"二分法可能不成立"）。它像一份永远"一方面……另一方面"的委员会报告。

两种策略在不同场景下各有价值。但对于这个具体的问题——一个用户试图建立对模型版本体系的理解——4.6 的策略明显更有帮助。原因很简单：专家的价值不在于知道有哪些可能，而在于告诉你哪个更可能。把所有可能性列全然后说"取决于具体情况"，这是维基百科能做的事。人找专家要的是"如果让你赌一个，你赌哪个，为什么"。4.8 系统性地回避了这个动作。

在第二轮的追问中也是如此。我问"为什么知道 Opus 4.6 和 4.7 是同一个系列"，4.6 直接回答"因为它们的模型规模一致"，并引用了开源模型家族作类比，给了具体的 benchmark 数据来展示系列间的差异模式。4.8 则回答了一个更"深刻"的洞察——"Opus 不是权重里某个可测量的内在属性，而是 Anthropic 的产品定位标签，是声明出来的，不是测出来的。"

说实话，4.8 的这个洞察本身是好的。但它带来的副作用是：为了这一点额外的精确，读者失去了一个可以直接理解的锚点。4.6 的"规模一致"可能不够严谨（参数量确实没公开），但它给了读者一个清晰的理解抓手。4.8 的"产品标签"更准确，但读者读完之后对"系列差异的本质"这个问题反而更模糊了。

有时候，**一个不完美但可用的框架，比一个完美但空洞的声明更有用**。

## 最诡异的发现：AI 自己看不出这个问题

这是整个测试中最让我意外的部分。

我让两个模型互相评价对方的回答，4.6 评价说 4.8 更好，4.8 也评价说 4.8 更好。这意味着，连 4.6 自己——那个我作为读者更喜欢的模型——也认为 4.8 的回答更优。

这个现象至少可以从两个角度来理解。

**第一个角度是评价标准的错位。**模型在评价回答时，启动的基本上是"审稿模式"——找错、挑 overclaim、看逻辑是否严谨。在这套标准下，4.8 的"我不能确认"几乎无懈可击，4.6 的"合理推断是 X"会被标记为"可质疑的断言"。但作为读者，我衡量的不是"这段文字能不能通过审查"，而是"读完之后我脑子里多了什么"。模型可以识别文本的客观属性，但它很难模拟一个真实读者的主观认知增量——我读之前对这个问题理解到什么程度，读之后又理解到什么程度，这个差值才是"有没有用"的真正度量。

**第二个角度更深一些：这可能是一个训练闭环**。模型被训练去避免过度断言——谨慎的表述在训练中更不容易被惩罚，冒险的判断更容易触发负面反馈。这导致模型既倾向于生产谨慎的文本，也倾向于在评价时奖励谨慎的文本。生产端和评价端用了同一套偏好函数，形成了自我强化的循环：越谨慎 → 评价越高 → 更谨慎。

这可能是为什么 4.6 也会判定 4.8 更好——即使 4.6 自己的回答风格更敢下判断，但当它切换到"评价者"角色时，启用的是同一套"谨慎即正确"的标准。自己写的时候还没那么收敛，但评价别人的时候，这个偏好就浮现了。

## 这对我们使用 AI 意味着什么

说几点实际的。

**第一，模型升级不等于对你更好用。**Benchmark 提升、诚实度提升、安全性提升，这些在统计层面都是真实的改进。但"对你这个具体用户在这类具体任务上更有用"是另一回事。如果你要的是分析和判断——战略思考、方案比较、趋势预判——新版本的谨慎倾向可能反而是退步。如果你要的是严格不出错——事实核查、法律文本、学术引用——新版本的严谨是真实的优势。不同任务适配不同版本，这件事可能会变得越来越重要。

**第二，不要让 AI 评价 AI 来替代你自己的判断。**这个测试最清楚地展示了这个陷阱——如果我没有自己读这四份回答、凭真实体感做判断，而是直接让模型帮我选，我会被引向一个"更无懈可击但更没用"的方向。模型的评价标准和你的使用标准之间存在系统性错位，而且这种错位在模型变得更"聪明"之后可能不会缩小，反而会扩大。

**第三，你的提示词可能需要适配模型的性格。**面对 4.8 这种倾向于 hedge 的模型，你可能需要在提示词里明确要求"给我你的最佳判断，标注把握程度，不要只列可能性"。这在 4.6 的时候不需要额外操心。模型的默认行为在版本间会漂移，你的使用方式也需要跟着调整。

## 最后

## AI 行业现在可能在"显得正确"和"真正有用"之间，悄悄偏向了前者。

每一轮 RLHF 迭代、每一次安全训练、每一次对齐调优，都在让模型更难被挑错——但也可能在让它变得更像一个永远"一方面……另一方面"的滑头顾问。如果这个趋势走到极端，最终用户的体感可能是"AI 越来越聪明，但越来越没用"。

而最值得警惕的是：用 AI 自己的评价体系去检测这个问题，恰恰检测不出来——因为评价标准本身就是同一套训练的产物。发现问题的，是那个自己读完、觉得"嗯，都对，但好像什么都没说"的人。

**在 AI 变得越来越正确的路上，"有用"可能是一个比我们以为的更容易被牺牲掉的东西。**

我建了一个AI学习群，目前几十来人，都是在真正动手学AI的人。如果你也在自己跑模型、写代码、做项目，欢迎加我微信，备注"你在做的AI方向"，聊得来的话我拉你进群。纯围观的就不加了，群里大家都在真搞。

![](images/5b4554/img_002.jpg)
