首页 / 文章 / AI持续学习

我们研究了 claude.ai 的系统提示词

格里灰丝2026.10.02约 2722 字 · 6 分钟Markdown 原文

我们做了一个基于 Claude 的问答服务(《我的问答版Claude"中转站"上线了!》写过,chat.goutoujunshi.cn)。上线之后有一个绕不开的问题:怎么让回答的质量跟 claude.ai 官网一样好,同时还能把 token 消耗压下来。这两个目标看起来是矛盾的,一个要效果,一个要省钱。

这两个目标都指向同一个东西:系统提示词。Claude 每次响应之前,都会先读一段系统提示词,这段内容决定了它用什么语气、什么格式、什么规则来回答。claude.ai 官网有自己的一套,我们也得有自己的。两边用的是同一个模型,同一个版本的 Opus 4.6/5.5,区别就在这段提示词上。

研究的起因很直接。一开始我们自己写的提示词只有两句话,一百多个字节。其中一句叫"先给结论再给解释"。跑出来的效果就是每次回答都顶着一个大标题"结论:……",后面跟一堆 emoji 分节。换一种问法再问同一个问题,风格可能完全不一样。拿这个回答和 claude.ai 官网的放在一起看,差距一目了然,跟那些用假 API 冒充官方的山寨服务没什么区别。

这个差距没法忍,于是决定认真研究一下,claude.ai 的提示词到底是怎么写的。

先照抄

Anthropic 公开过 claude.ai 的系统提示词。拿过来一看,两万两千多字节,大概五六千个 token。

我们做了最简单的一件事:整段换上,一个字不改。效果非常直接。回答的排版稳定了,格式克制了,风格也一致了。之前那种忽冷忽热、每次回答都像换了个人的感觉,一下就没了。

同一个模型、同一个版本,从两句话换成两万多字节,整个回答的气质就变了。

两万字里有什么

效果好了,但两万多字节的提示词,不可能每一段都跟回答质量有关。仔细读下来,里面有大量的内容是 claude.ai 这个产品自身需要的东西。

比如有一段专门讲拒绝策略的细节,什么情况下拒绝、拒绝的时候怎么措辞。有一段法律和金融领域的免责声明。有一段心理健康方面的干预流程,包括自杀风险怎么处理、心理危机怎么引导。有一段处理政治敏感话题的中立性原则。还有选举信息的处理规则,以及一整段套餐和 API 的产品说明。

这些段落是 Anthropic 作为平台方需要覆盖的内容,写进系统提示词有它的道理。但对我们来说,这些全是产品层面的东西。模型自身的安全训练已经覆盖了基础面,这些附加段落对回答质量没有帮助,反而每轮对话都要带上去,白白消耗 token。

问题就变成了:到底哪些能删、哪些不能删?这得一段一段验证。

删了一半

我们把"删减提示词"这件事当成一个正式的工程任务来做。规则定得很死:只允许整行删除,不许改写,不许合并,不许翻译。验收的时候逐行比对,确保候选文件里的每一行都在原文中逐字节存在。

定这个规则是因为删减提示词天然是一件主观的事,不约束的话很容易删着删着就开始改写,改着改着意思就偏了。把操作限制成纯机械的"留或者删",结果才可控。

按照这个规则,从两万两千多字节删到了一万零四百字节。去掉的七个段落分别是:拒绝策略细节、法律金融免责、心理健康干预、Anthropic 提醒机制、政治中立性、选举信息块、产品套餐与 API 说明。

删完之后测了一轮,回答质量没有变化。这就验证了前面的判断:这些段落确实是产品层的东西,和回答质量无关。

不如自己写

删到只剩一半,一个自然的问题就出来了:既然一半都跟我们没关系,那剩下的这一半,组织方式也是按 claude.ai 的逻辑来的,未必贴合我们自己的使用场景。与其在别人的框架里做减法,不如从自己的实际需求出发写一套。

最终版八个段落。每一段都有对应的来源,是在真实的对照测试中发现了具体的差距之后才加的。

举一个例子。我们做对照测试的时候,有一组是让 Claude 帮忙梳理一份汇报材料。我们的版本自己发明了一条"人工智能与实体经济深度融合"的主线,整篇回答都围绕这条线展开,看起来很通顺。但用户追问了一句:"是我的大纲里强调了实体经济吗?"回去翻原始素材,根本没有这个方向。Claude 自己编了一个框架塞进去了。

同一个问题拿去 claude.ai 官网问,官网的回答完全不同。没有发明任何主线,而是逐节核对素材里有什么、缺什么、哪一节写的其实是别家企业的成果、哪一节的数字前后不一致。

这个差距转化成了提示词里的一个专门段落:处理用户给的素材时,先做存在性和一致性的具体检查,不要替用户发明框架,收尾点名需要用户自己拍板的地方。

八个段落里,每一个都是这么来的。有真实的差距,有明确的根因,然后才写成一条规则。没有任何一段是"感觉应该有"。

搜索引用的那笔账

还有一个问题花了比较长时间才查清楚。

对照测试中发现,问 Claude 某个产品的价格,claude.ai 官网能引到厂商的官方定价页,给出具体的价格档位和各种附加条件。我们的版本引的是第三方转载站,信息模糊,有时候还过时了。

一开始以为是提示词写得不够明确,加了"必须引用一手来源"的规则。好了一些,但还是差一截。继续查下去,发现有一部分原因出在我们之前为了省 token 做的优化上。在读取网页的环节,我们做了压缩处理,交给模型的是压缩后的摘要内容,不是页面全文。token 是省下来了,但模型拿到的是二手信息,引用的细节自然比不过拿到全文的官网版本。

这是 Harness 工程里经常遇到的情况:为了省成本做的优化,可能在回答质量上悄悄打了折扣。这种折扣不容易被发现,日常使用中感觉不出来,要专门做对照才能看出差距在哪。

后来的做法是分场景处理。对于官方域名、厂商页面这类关键来源,读全文,不压缩,确保模型拿到的是一手信息。其他来源还是用摘要。在效果基本不降的前提下,把 token 消耗整体控制住。

这样就把最开始那个"效果和成本的矛盾"往前推了一步:不是所有地方都需要全文,也不是所有地方都能用摘要,关键是搞清楚哪些地方的质量不能打折。

还在继续

提示词现在是第六版。从最早的两句话,到照抄官方两万字,到逐段删减验证,到全部自己写,到根据搜索引用的对照结果继续调,走了一整条路。

我们在产品里加了点赞和差评按钮,差评带原因标签。下一轮改提示词,就看差评集中在什么方向,对应去调什么段落。越来越好。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。

如果你也在自己跑模型、写代码、做项目,

或者使用Claude和Claude code,

欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。

← 返回「AI持续学习」回到顶部 ↑