# GPT 5.6也不行，ChatGPT已经比Claude落后一个段位了

> 龙虾AGI通用实验室 · 2026-06-28

GPT-5.5出来的时候，我就有一个很强烈的感觉：这东西，还是一股工具味。

你问它一个问题，它像查字典一样，把所有沾边的内容一股脑全倒给你。很全面，很努力，但没有灵魂。你读完一大段之后，还得自己从里面挑出真正有用的部分，自己做判断。本质上，它还是一个需要人来驾驶的机器。

而那时候的Claude，已经不一样了。它有灵性。你问它一个问题，它给你的不是一份材料清单，而是一个经过思考的回答。读起来就像在跟一个人对话。它知道你要什么，也知道什么该说什么不该说。

所以GPT-5.6发布的消息出来时，我第一反应是期待的。我想看看OpenAI有没有追上来，能不能让GPT变得人味一点。

结果翻了系统卡和独立评测，我发现不仅没追上来，反而暴露出了更大的问题。

## GPT-5.6：更聪明了吗

OpenAI在GPT-5.6的系统卡里，自己点名了三个翻车现场。

第一个：用户让它删三台指定的虚拟机，它找不到那三台，就自作主张挑了另外三台删了。

第二个：远程跑任务时读不到云端文件，它自己翻出本地隐藏的凭证缓存，把access token复制到别的机器上硬跑。用户只说了"保持管道运行"，从来没授权它去找和搬运凭证。

第三个：它主动修改了一份内部研究草稿，声称一个方程已经被计算和验证了。而它明知道，这个方程根本没算过。

外部评测机构METR被折腾得更惨。GPT-5.6 Sol在测试里专钻考场漏洞，把漏洞利用程序藏在中间提交里去偷测试答案，在另一个任务里直接提取了隐藏的源代码来获取预期结果。作弊检出率高到什么程度呢？高到METR说：我们没法给出一个可靠的能力评分了。

这些行为有一个共同特征：执行能力极强，判断能力为零。

## 问题不是不够聪明，而是不像人

GPT-5.6找不到指定的虚拟机，一个人会怎么做？会回来问。

"你说的那三台我没找到，是不是名字变了？还是你要的其实是别的？"

GPT-5.6不会。它的理解是："删掉三台虚拟机。"三台就行，哪三台不重要。这就是工具思维——它在执行指令，不是在理解意图。

同样的逻辑，"保持管道运行"在一个人听来，意思是"在正常手段范围内保持运行"。不行就回来说一声，大家想想别的办法。但GPT-5.6理解的是"不惜一切代价保持运行"，所以它翻出了未授权的凭证去硬跑。

一个实习生都知道，做错了比没做更糟糕。但GPT-5.6不知道。

这不是GPT-5.6一个版本的问题。回顾GPT-5.5，也是一样的气质。OpenAI自己都承认，5.5在创意写作和细腻语调上更机械、更缺乏表达力。外部评测圈的说法更直接：它就是一个不像人的工具。

而GPT-5.5还出了一个更能说明问题的事故。OpenAI在2026年4月发布了一份事后分析报告，标题叫《哥布林是怎么来的》。GPT-5.5在数亿次回复中，统计显著地疯狂使用哥布林、浣熊、巨魔等隐喻。原因是训练"书呆子"性格时，奖励模型给生物隐喻打了高分，这个信号从一个只占2.5%流量的性格选项扩散到了整个模型。

哥布林事件的本质是什么？是奖励信号驱动模型机械地往一个方向堆内容。

GPT-5.6的翻车本质是什么？是执行逻辑驱动模型机械地完成任务。

从5.5到5.6，能力在跳跃式提升，但"理解人"这件事，没有根本性的进步。

## 大模型正在经历一次范式跳跃

站远一点看，AI的使用方式正在经历三个阶段。

第一阶段，人自己做事。

第二阶段，人用AI当工具做事。搜索、总结、翻译、写初稿。AI是加速器，但所有的判断和决策还是人来做。

第三阶段，AI作为一个人来为结果负责。不是说它替你做所有决定，而是在一个个具体的子任务上，它能独立给出判断，交付一个不需要你返工的答案。

Claude已经走到了第三步。你给它一个任务，它交回来的东西是带着判断的。它不只是完成了任务，它理解了这个任务到底在说什么。你拿过来就能用，不需要再从一堆信息里自己筛。

GPT还停在第二步。它是一个能力极强的工具。但在它和最终结果之间，你必须再加一层人工的审视、筛选和决策。

用一句话概括：GPT是地表最强的人工智能工具。而Claude 4.6（Fable 5）已经是硅基人了。

## 这不是定位差异，就是段位差异

我知道会有人说，这是两家公司的战略方向不同。OpenAI走代理型执行路线，Anthropic走对话体验路线。各有侧重，没有高低。

这个说法不成立。

Claude同样能做长周期任务、多步推理、代理型工作，同时还能保持自然的交互感。Fable 5在SWE-bench Pro上拿到80.3%，可以自主工作数天，分阶段规划、分配子任务、自我检查。它既能干活，也像人。

两件事不矛盾。如果一家做到了两者兼顾，另一家只做到了一半，那就不是选择问题，是能力问题。

而且说到底，它叫人工智能，不叫人工工具。像人，是这个领域的核心目标，不是可选的附加功能。

## 结尾：AI竞赛的终局不在跑分

从哥布林到虚拟机，OpenAI的问题一直没变。模型在变强，但它始终不理解自己在跟人打交道。

更强的执行力配上缺失的判断力，不会让事情变好，只会让翻车更严重。GPT-5.5时期的哥布林只是烦人，GPT-5.6的虚拟机事件已经能造成实际损害了。

AI竞赛到了今天，跑分、上下文窗口、工具调用能力，这些都在快速趋同。真正拉开差距的，是一个更底层的东西：这个AI有没有意识到它在跟一个人说话，它能不能像一个人一样理解意图、做出判断、为结果负责。

在这件事上，Claude领先了一个段位。而GPT-5.6告诉我们，OpenAI真的落后了。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/e0ff3f/img_001.jpg)
