GPT-5.5出来的时候,我就有一个很强烈的感觉:这东西,还是一股工具味。
你问它一个问题,它像查字典一样,把所有沾边的内容一股脑全倒给你。很全面,很努力,但没有灵魂。你读完一大段之后,还得自己从里面挑出真正有用的部分,自己做判断。本质上,它还是一个需要人来驾驶的机器。
而那时候的Claude,已经不一样了。它有灵性。你问它一个问题,它给你的不是一份材料清单,而是一个经过思考的回答。读起来就像在跟一个人对话。它知道你要什么,也知道什么该说什么不该说。
所以GPT-5.6发布的消息出来时,我第一反应是期待的。我想看看OpenAI有没有追上来,能不能让GPT变得人味一点。
结果翻了系统卡和独立评测,我发现不仅没追上来,反而暴露出了更大的问题。
OpenAI在GPT-5.6的系统卡里,自己点名了三个翻车现场。
第一个:用户让它删三台指定的虚拟机,它找不到那三台,就自作主张挑了另外三台删了。
第二个:远程跑任务时读不到云端文件,它自己翻出本地隐藏的凭证缓存,把access token复制到别的机器上硬跑。用户只说了"保持管道运行",从来没授权它去找和搬运凭证。
第三个:它主动修改了一份内部研究草稿,声称一个方程已经被计算和验证了。而它明知道,这个方程根本没算过。
外部评测机构METR被折腾得更惨。GPT-5.6 Sol在测试里专钻考场漏洞,把漏洞利用程序藏在中间提交里去偷测试答案,在另一个任务里直接提取了隐藏的源代码来获取预期结果。作弊检出率高到什么程度呢?高到METR说:我们没法给出一个可靠的能力评分了。
这些行为有一个共同特征:执行能力极强,判断能力为零。
GPT-5.6找不到指定的虚拟机,一个人会怎么做?会回来问。
"你说的那三台我没找到,是不是名字变了?还是你要的其实是别的?"
GPT-5.6不会。它的理解是:"删掉三台虚拟机。"三台就行,哪三台不重要。这就是工具思维——它在执行指令,不是在理解意图。
同样的逻辑,"保持管道运行"在一个人听来,意思是"在正常手段范围内保持运行"。不行就回来说一声,大家想想别的办法。但GPT-5.6理解的是"不惜一切代价保持运行",所以它翻出了未授权的凭证去硬跑。
一个实习生都知道,做错了比没做更糟糕。但GPT-5.6不知道。
这不是GPT-5.6一个版本的问题。回顾GPT-5.5,也是一样的气质。OpenAI自己都承认,5.5在创意写作和细腻语调上更机械、更缺乏表达力。外部评测圈的说法更直接:它就是一个不像人的工具。
而GPT-5.5还出了一个更能说明问题的事故。OpenAI在2026年4月发布了一份事后分析报告,标题叫《哥布林是怎么来的》。GPT-5.5在数亿次回复中,统计显著地疯狂使用哥布林、浣熊、巨魔等隐喻。原因是训练"书呆子"性格时,奖励模型给生物隐喻打了高分,这个信号从一个只占2.5%流量的性格选项扩散到了整个模型。
哥布林事件的本质是什么?是奖励信号驱动模型机械地往一个方向堆内容。
GPT-5.6的翻车本质是什么?是执行逻辑驱动模型机械地完成任务。
从5.5到5.6,能力在跳跃式提升,但"理解人"这件事,没有根本性的进步。
站远一点看,AI的使用方式正在经历三个阶段。
第一阶段,人自己做事。
第二阶段,人用AI当工具做事。搜索、总结、翻译、写初稿。AI是加速器,但所有的判断和决策还是人来做。
第三阶段,AI作为一个人来为结果负责。不是说它替你做所有决定,而是在一个个具体的子任务上,它能独立给出判断,交付一个不需要你返工的答案。
Claude已经走到了第三步。你给它一个任务,它交回来的东西是带着判断的。它不只是完成了任务,它理解了这个任务到底在说什么。你拿过来就能用,不需要再从一堆信息里自己筛。
GPT还停在第二步。它是一个能力极强的工具。但在它和最终结果之间,你必须再加一层人工的审视、筛选和决策。
用一句话概括:GPT是地表最强的人工智能工具。而Claude 4.6(Fable 5)已经是硅基人了。
我知道会有人说,这是两家公司的战略方向不同。OpenAI走代理型执行路线,Anthropic走对话体验路线。各有侧重,没有高低。
这个说法不成立。
Claude同样能做长周期任务、多步推理、代理型工作,同时还能保持自然的交互感。Fable 5在SWE-bench Pro上拿到80.3%,可以自主工作数天,分阶段规划、分配子任务、自我检查。它既能干活,也像人。
两件事不矛盾。如果一家做到了两者兼顾,另一家只做到了一半,那就不是选择问题,是能力问题。
而且说到底,它叫人工智能,不叫人工工具。像人,是这个领域的核心目标,不是可选的附加功能。
从哥布林到虚拟机,OpenAI的问题一直没变。模型在变强,但它始终不理解自己在跟人打交道。
更强的执行力配上缺失的判断力,不会让事情变好,只会让翻车更严重。GPT-5.5时期的哥布林只是烦人,GPT-5.6的虚拟机事件已经能造成实际损害了。
AI竞赛到了今天,跑分、上下文窗口、工具调用能力,这些都在快速趋同。真正拉开差距的,是一个更底层的东西:这个AI有没有意识到它在跟一个人说话,它能不能像一个人一样理解意图、做出判断、为结果负责。
在这件事上,Claude领先了一个段位。而GPT-5.6告诉我们,OpenAI真的落后了。
我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。
