# 我们研究了 claude.ai 的系统提示词

> 龙虾AGI通用实验室 · 2026-10-02

我们做了一个基于 Claude 的问答服务（《我的问答版Claude"中转站"上线了！》写过，chat.goutoujunshi.cn）。上线之后有一个绕不开的问题：怎么让回答的质量跟 claude.ai 官网一样好，同时还能把 token 消耗压下来。这两个目标看起来是矛盾的，一个要效果，一个要省钱。

这两个目标都指向同一个东西：系统提示词。Claude 每次响应之前，都会先读一段系统提示词，这段内容决定了它用什么语气、什么格式、什么规则来回答。claude.ai 官网有自己的一套，我们也得有自己的。两边用的是同一个模型，同一个版本的 Opus 4.6/5.5，区别就在这段提示词上。

研究的起因很直接。一开始我们自己写的提示词只有两句话，一百多个字节。其中一句叫"先给结论再给解释"。跑出来的效果就是每次回答都顶着一个大标题"结论：……"，后面跟一堆 emoji 分节。换一种问法再问同一个问题，风格可能完全不一样。拿这个回答和 claude.ai 官网的放在一起看，差距一目了然，跟那些用假 API 冒充官方的山寨服务没什么区别。

这个差距没法忍，于是决定认真研究一下，claude.ai 的提示词到底是怎么写的。

## 先照抄

Anthropic 公开过 claude.ai 的系统提示词。拿过来一看，两万两千多字节，大概五六千个 token。

我们做了最简单的一件事：整段换上，一个字不改。效果非常直接。回答的排版稳定了，格式克制了，风格也一致了。之前那种忽冷忽热、每次回答都像换了个人的感觉，一下就没了。

同一个模型、同一个版本，从两句话换成两万多字节，整个回答的气质就变了。

## 两万字里有什么

效果好了，但两万多字节的提示词，不可能每一段都跟回答质量有关。仔细读下来，里面有大量的内容是 claude.ai 这个产品自身需要的东西。

比如有一段专门讲拒绝策略的细节，什么情况下拒绝、拒绝的时候怎么措辞。有一段法律和金融领域的免责声明。有一段心理健康方面的干预流程，包括自杀风险怎么处理、心理危机怎么引导。有一段处理政治敏感话题的中立性原则。还有选举信息的处理规则，以及一整段套餐和 API 的产品说明。

这些段落是 Anthropic 作为平台方需要覆盖的内容，写进系统提示词有它的道理。但对我们来说，这些全是产品层面的东西。模型自身的安全训练已经覆盖了基础面，这些附加段落对回答质量没有帮助，反而每轮对话都要带上去，白白消耗 token。

问题就变成了：到底哪些能删、哪些不能删？这得一段一段验证。

## 删了一半

我们把"删减提示词"这件事当成一个正式的工程任务来做。规则定得很死：只允许整行删除，不许改写，不许合并，不许翻译。验收的时候逐行比对，确保候选文件里的每一行都在原文中逐字节存在。

定这个规则是因为删减提示词天然是一件主观的事，不约束的话很容易删着删着就开始改写，改着改着意思就偏了。把操作限制成纯机械的"留或者删"，结果才可控。

按照这个规则，从两万两千多字节删到了一万零四百字节。去掉的七个段落分别是：拒绝策略细节、法律金融免责、心理健康干预、Anthropic 提醒机制、政治中立性、选举信息块、产品套餐与 API 说明。

删完之后测了一轮，回答质量没有变化。这就验证了前面的判断：这些段落确实是产品层的东西，和回答质量无关。

## 不如自己写

删到只剩一半，一个自然的问题就出来了：既然一半都跟我们没关系，那剩下的这一半，组织方式也是按 claude.ai 的逻辑来的，未必贴合我们自己的使用场景。与其在别人的框架里做减法，不如从自己的实际需求出发写一套。

最终版八个段落。每一段都有对应的来源，是在真实的对照测试中发现了具体的差距之后才加的。

举一个例子。我们做对照测试的时候，有一组是让 Claude 帮忙梳理一份汇报材料。我们的版本自己发明了一条"人工智能与实体经济深度融合"的主线，整篇回答都围绕这条线展开，看起来很通顺。但用户追问了一句："是我的大纲里强调了实体经济吗？"回去翻原始素材，根本没有这个方向。Claude 自己编了一个框架塞进去了。

同一个问题拿去 claude.ai 官网问，官网的回答完全不同。没有发明任何主线，而是逐节核对素材里有什么、缺什么、哪一节写的其实是别家企业的成果、哪一节的数字前后不一致。

这个差距转化成了提示词里的一个专门段落：处理用户给的素材时，先做存在性和一致性的具体检查，不要替用户发明框架，收尾点名需要用户自己拍板的地方。

八个段落里，每一个都是这么来的。有真实的差距，有明确的根因，然后才写成一条规则。没有任何一段是"感觉应该有"。

## 搜索引用的那笔账

还有一个问题花了比较长时间才查清楚。

对照测试中发现，问 Claude 某个产品的价格，claude.ai 官网能引到厂商的官方定价页，给出具体的价格档位和各种附加条件。我们的版本引的是第三方转载站，信息模糊，有时候还过时了。

一开始以为是提示词写得不够明确，加了"必须引用一手来源"的规则。好了一些，但还是差一截。继续查下去，发现有一部分原因出在我们之前为了省 token 做的优化上。在读取网页的环节，我们做了压缩处理，交给模型的是压缩后的摘要内容，不是页面全文。token 是省下来了，但模型拿到的是二手信息，引用的细节自然比不过拿到全文的官网版本。

这是 Harness 工程里经常遇到的情况：为了省成本做的优化，可能在回答质量上悄悄打了折扣。这种折扣不容易被发现，日常使用中感觉不出来，要专门做对照才能看出差距在哪。

后来的做法是分场景处理。对于官方域名、厂商页面这类关键来源，读全文，不压缩，确保模型拿到的是一手信息。其他来源还是用摘要。在效果基本不降的前提下，把 token 消耗整体控制住。

这样就把最开始那个"效果和成本的矛盾"往前推了一步：不是所有地方都需要全文，也不是所有地方都能用摘要，关键是搞清楚哪些地方的质量不能打折。

## 还在继续

提示词现在是第六版。从最早的两句话，到照抄官方两万字，到逐段删减验证，到全部自己写，到根据搜索引用的对照结果继续调，走了一整条路。

我们在产品里加了点赞和差评按钮，差评带原因标签。下一轮改提示词，就看差评集中在什么方向，对应去调什么段落。越来越好。

![](images/9b1508/img_001.png)

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。

如果你也在自己**跑模型、写代码、做项目**，

或者使用**Claude**和**Claude code**，

欢迎**点赞关注转发**一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/9b1508/img_002.jpg)
