
今天凌晨,Anthropic 发布了 Claude Opus 4.8。官方描述的核心改进是"诚实性"——模型更善于标记自身的不确定性,会对不合理的方案主动提出质疑。
这听起来毫无争议地是好事。于是我拿同一组问题分别测了 4.6 和 4.8,想看看写作和思考深度上到底有什么变化。结果让我意外——不是因为 4.8 变差了,恰恰相反,它说的每一句话都更"正确"。但我读完之后,反而觉得什么都没学到。
测试的问题是关于 Claude 模型版本体系的:Opus 4.6 和 4.8 的预训练基座是不是同一个?Opus 和 Sonnet 的差异本质是什么?大版本号和小版本号分别代表什么?——这类问题没有公开的标准答案,Anthropic 从未披露过模型之间的架构细节,所以很适合测试模型在不确定性下的分析能力。
每个问题我让 4.6 和 4.8 各回答一次,然后交叉让它们互相评价对方的回答。两轮问题,四份回答,四次交叉评价。
先说结论:4.6 的回答我读完觉得有收获,4.8 的回答我读完觉得"嗯,确实都对,但我好像什么新东西都没得到"。而最诡异的是——不管是 4.6 还是 4.8,在评价对方时,都认为 4.8 的回答更好。
挑一个最能说明问题的例子。
我问:"Opus 4.6 和 4.8 的预训练模型是否是同一个,只是后训练不同?"
4.6 的回答大意是:Anthropic 没有正式确认过,但从外部可以观察到强烈的信号——4.8 与 4.7 使用相同的工具接口和架构,价格保持不变,官方描述是"建立在 4.7 之上"。所以合理推断是,同一个大版本号内的小版本更新,很可能共享同一个预训练基座,差异主要来自后训练。但这不是官方表态,而是社区基于可观测行为的推断。
4.8 的回答大意是:这个我没法确认。Anthropic 不公开披露各版本之间在预训练层面的关系,我自己作为模型也无法"内省"出自己的训练细节。而且,现代训练流程中 mid-training、continued pretraining 等阶段让"预训练 vs 后训练"的二分法变得模糊,你这个问题的提法本身,可能就和真实情况对不齐。
注意,4.8 说的没有一句话是错的。"无法确认"是事实,"二分法可能不准确"是有见地的补充。但问题在于——读完 4.6 的回答,我对这个问题有了一个可以拿走的判断框架,虽然这个框架将来可能被证伪;读完 4.8 的回答,我知道了"这个问题很复杂"和"没人能给你确切答案",然后呢?没有然后了。
这就是我说的"正确的废话"——每句都对,但信息量趋近于零。
仔细对比两轮问答后,我发现差异不是偶然的,而是体现了两种截然不同的回答策略。
4.6 做了三件事:押一个方向("很可能共享基座")、给出支撑依据(价格不变、接口相同、官方措辞)、标注把握程度("这不是官方表态,是社区推断")。它像一个愿意下注的分析师。
4.8 做了另外三件事:列出所有可能性(后训练优化、继续预训练、数据配比调整……)、拒绝押方向("外部无法确定")、质疑问题本身的框架("二分法可能不成立")。它像一份永远"一方面……另一方面"的委员会报告。
两种策略在不同场景下各有价值。但对于这个具体的问题——一个用户试图建立对模型版本体系的理解——4.6 的策略明显更有帮助。原因很简单:专家的价值不在于知道有哪些可能,而在于告诉你哪个更可能。把所有可能性列全然后说"取决于具体情况",这是维基百科能做的事。人找专家要的是"如果让你赌一个,你赌哪个,为什么"。4.8 系统性地回避了这个动作。
在第二轮的追问中也是如此。我问"为什么知道 Opus 4.6 和 4.7 是同一个系列",4.6 直接回答"因为它们的模型规模一致",并引用了开源模型家族作类比,给了具体的 benchmark 数据来展示系列间的差异模式。4.8 则回答了一个更"深刻"的洞察——"Opus 不是权重里某个可测量的内在属性,而是 Anthropic 的产品定位标签,是声明出来的,不是测出来的。"
说实话,4.8 的这个洞察本身是好的。但它带来的副作用是:为了这一点额外的精确,读者失去了一个可以直接理解的锚点。4.6 的"规模一致"可能不够严谨(参数量确实没公开),但它给了读者一个清晰的理解抓手。4.8 的"产品标签"更准确,但读者读完之后对"系列差异的本质"这个问题反而更模糊了。
有时候,一个不完美但可用的框架,比一个完美但空洞的声明更有用。
这是整个测试中最让我意外的部分。
我让两个模型互相评价对方的回答,4.6 评价说 4.8 更好,4.8 也评价说 4.8 更好。这意味着,连 4.6 自己——那个我作为读者更喜欢的模型——也认为 4.8 的回答更优。
这个现象至少可以从两个角度来理解。
第一个角度是评价标准的错位。模型在评价回答时,启动的基本上是"审稿模式"——找错、挑 overclaim、看逻辑是否严谨。在这套标准下,4.8 的"我不能确认"几乎无懈可击,4.6 的"合理推断是 X"会被标记为"可质疑的断言"。但作为读者,我衡量的不是"这段文字能不能通过审查",而是"读完之后我脑子里多了什么"。模型可以识别文本的客观属性,但它很难模拟一个真实读者的主观认知增量——我读之前对这个问题理解到什么程度,读之后又理解到什么程度,这个差值才是"有没有用"的真正度量。
第二个角度更深一些:这可能是一个训练闭环。模型被训练去避免过度断言——谨慎的表述在训练中更不容易被惩罚,冒险的判断更容易触发负面反馈。这导致模型既倾向于生产谨慎的文本,也倾向于在评价时奖励谨慎的文本。生产端和评价端用了同一套偏好函数,形成了自我强化的循环:越谨慎 → 评价越高 → 更谨慎。
这可能是为什么 4.6 也会判定 4.8 更好——即使 4.6 自己的回答风格更敢下判断,但当它切换到"评价者"角色时,启用的是同一套"谨慎即正确"的标准。自己写的时候还没那么收敛,但评价别人的时候,这个偏好就浮现了。
说几点实际的。
第一,模型升级不等于对你更好用。Benchmark 提升、诚实度提升、安全性提升,这些在统计层面都是真实的改进。但"对你这个具体用户在这类具体任务上更有用"是另一回事。如果你要的是分析和判断——战略思考、方案比较、趋势预判——新版本的谨慎倾向可能反而是退步。如果你要的是严格不出错——事实核查、法律文本、学术引用——新版本的严谨是真实的优势。不同任务适配不同版本,这件事可能会变得越来越重要。
第二,不要让 AI 评价 AI 来替代你自己的判断。这个测试最清楚地展示了这个陷阱——如果我没有自己读这四份回答、凭真实体感做判断,而是直接让模型帮我选,我会被引向一个"更无懈可击但更没用"的方向。模型的评价标准和你的使用标准之间存在系统性错位,而且这种错位在模型变得更"聪明"之后可能不会缩小,反而会扩大。
第三,你的提示词可能需要适配模型的性格。面对 4.8 这种倾向于 hedge 的模型,你可能需要在提示词里明确要求"给我你的最佳判断,标注把握程度,不要只列可能性"。这在 4.6 的时候不需要额外操心。模型的默认行为在版本间会漂移,你的使用方式也需要跟着调整。
每一轮 RLHF 迭代、每一次安全训练、每一次对齐调优,都在让模型更难被挑错——但也可能在让它变得更像一个永远"一方面……另一方面"的滑头顾问。如果这个趋势走到极端,最终用户的体感可能是"AI 越来越聪明,但越来越没用"。
而最值得警惕的是:用 AI 自己的评价体系去检测这个问题,恰恰检测不出来——因为评价标准本身就是同一套训练的产物。发现问题的,是那个自己读完、觉得"嗯,都对,但好像什么都没说"的人。
在 AI 变得越来越正确的路上,"有用"可能是一个比我们以为的更容易被牺牲掉的东西。
我建了一个AI学习群,目前几十来人,都是在真正动手学AI的人。如果你也在自己跑模型、写代码、做项目,欢迎加我微信,备注"你在做的AI方向",聊得来的话我拉你进群。纯围观的就不加了,群里大家都在真搞。
