# 我的问答版Claude"中转站"上线了！

> 龙虾AGI通用实验室 · 2026-09-17

我的 Claude 账号里有两种额度。Fable 的额度拿来写代码，基本上每个月都不够用，得精打细算。Opus 的额度拿来做问答和文字工作，情况完全相反：每周有一个使用上限，到期没用完就清零，下周重新开始。

Fable 不够用，这个没办法。但 Opus 用不完这件事，浪费了好几周之后就开始觉得可惜了。每到周末看一眼剩余额度，还有一大截，然后归零，下周又是满的，又用不完。

同一时间，周围陆续有朋友在问 Claude 怎么用、好不好用、值不值得折腾。问完之后真正去注册的没几个，大部分人卡在网络那一步就放弃了。这个事情也不好帮忙，每台设备的网络环境都不一样，远程指导半天也不一定搞得定。

我的额度在浪费，别人想用又用不上。这两件事拼在一起看，就有了一个想法：能不能把我用不完的 Opus 额度共享出去？

## 一个现成的条件

这个想法能落地，是因为有一个现成的条件。我有一台海外的服务器，上面之前就装好了 Claude Code，登着我自己的账号。Claude Code 本来是一个命令行工具，用来写代码的，但它的核心能力其实就是跟 Claude 模型对话。如果我在它前面搭一个网页界面，别人打开浏览器就能直接跟 Claude 聊天。

关键在于网络。服务器在海外，它跟 Claude 的通信是畅通的。用的人只需要能连上我的服务器就行，不需要自己去解决怎么连 Claude 的问题。网络这道坎，在服务器那一端就解决掉了。

这就是 chat.goutoujunshi.cn 的起点。一个很朴素的出发点：我有多余的额度，我有一台能连通的服务器，我可以做一个入口让别人也用上。对我来说额度不浪费了，对别人来说不用折腾网络了，双方都得到了好处。

## 为什么锁在 Opus 4.6

搭好之后第一个设计决定是选模型。Claude 这个系列后来陆续出了好几个版本，Opus 4.7、4.8、Opus 5 都有了。但这几个更新版本的发力方向都在代码能力上，编程任务确实越来越强，对话和文字方面的提升并不明显，有些场景下反而不如 4.6。

来我们这里用的人大概率不写代码。日常就是问问题、查资料、整理思路、帮忙梳理一些文档。这类场景下，Opus 4.6 是整个 Claude 系列里语言表达最稳、回答质量最高的一个版本。体感上，它更像一个真的在跟你交流的人。回答的方式像一个水平很高的朋友在帮你分析问题，有条理，有分寸，该展开的地方展开，该收的时候不啰嗦。

所以我们把模型固定在 Opus 4.6 上，不给选别的。与其让使用者在一堆版本号之间纠结，不如我们替大家做好这个判断。

现在在传 Opus 5.2 快出了。等出来之后会测一下问答效果，如果确实比 4.6 好，再考虑放出来。在那之前，4.6 就是我们的选择。

## 从"能用"到"跟官网一样"

第一版搭出来之后，基本功能没问题，能问能答，回复是流式输出的，打字效果和官网一样。但自己用了几轮就发现不少不舒服的地方。

比如回复过程中，如果 Claude 正在写一段代码，代码块的反引号还没闭合，页面上就会显示一段格式错乱的内容，要等整段写完才恢复正常。历史对话全部平铺在侧栏里，没有按日期分组，几天下来找一段旧对话要翻很久。余额也看不到，每条消息花了多少钱没有任何显示。

这些问题如果只是自己用，忍忍也行。但既然打算给别人用，细节就不能凑合了。于是开始一项一项补。

先补的是基础设施：注册和登录、余额显示和充值、一个像样的管理后台。然后是使用体验：对话按"今天""昨天""七天内"分组，每条回复下面显示费用，支持重新生成和从某一轮分叉出新对话。再然后是能力对齐：文件和图片上传、联网搜索、搜索结果带来源标签、数学公式渲染。

做着做着就产生了一个想法。claude.ai 官网能做到什么样，我们在技术上其实也都做得到。搜索结果有来源标签，点开能跳转到原文，这个能做。上传一份 PDF 或者 Excel 让 Claude 帮忙分析，这个也能做。回复里出现了一个数学公式，用 LaTeX 渲染出来而不是显示一串符号，这个同样能做。

既然做得到，为什么不就做到那个程度？

所以现在线上的版本，从功能和体验上来说，和 claude.ai 网页版已经非常接近了。界面风格、交互逻辑、排版细节，我们都在对标官网的标准。

## 后台的 Harness 工程优化

模型的能力是固定的，但围绕模型做的工程优化，直接影响回答质量和 token 消耗。这类工作行业里叫 Harness，我们在这一层花了不少功夫。

先说一个背景。Claude 的对话机制是每发一轮消息，之前所有的对话内容都要一起发过去，模型才能知道上下文在聊什么。对话越长，每一轮携带的上下文就越大，消耗的 token 就越多。Claude 本身有一套缓存机制，连续聊的时候，重复的上下文可以命中缓存，成本会低很多。但这个缓存有有效期，过期之后如果继续聊，就相当于把所有内容按全价重新算一遍。

官网的用户大概不需要关心这件事。但我们的额度是有限的，这笔账得管起来。我们做的事情是：当缓存过期或者上下文长到一定程度，系统会自动做一些操作，把 token 消耗控制住。对话不会断，Claude 还记得之前聊了什么，但不会因为缓存过期而突然产生一笔很大的开销。

另一个优化是在系统提示词层面。Claude 每次请求都会带一段系统提示词，告诉模型该怎么回答、遵守什么规则。官网的系统提示词有两万多字节，里面包含了大量只有 claude.ai 这个产品才需要的内容，比如套餐说明、API 文档引导、各种产品层面的策略。这些对我们的场景完全用不上，但每轮对话都会带上去，白白占 token。

我们根据自己的使用场景重写了系统提示词，去掉了所有跟我们无关的部分，只留下真正影响回答质量的规则。最终回答效果不变，每轮对话的固定开销减了将近一半。

这些优化对使用的人来说是完全傻瓜式的。不需要知道什么是 token，什么是缓存，什么时候该新开对话。我们把自己研究出来的这些东西都做进了后台的自动逻辑里，用的人正常聊就行。在这些细节上，我们其实比官网还做得细一些，因为我们确实花了时间在 Harness 这一层去研究和调整。

## 关于 token

我们的后台跑的就是我自己的 Claude 账号，每一条消息都是真实的 Opus 4.6 请求，token 是真的。每条消息消耗了多少输入 token、多少输出 token、有没有命中缓存、折算下来多少钱，在界面上都能看到明细。

## 来试试

地址：**chat.goutoujunshi.cn**

注册需要邀请码，名额有限，先到先得。现在还是试水阶段，欢迎大家来体验。

我们的新产品也已经整合到我们的主页上了：**goutoujunshi.cn**

![](images/c8e31f/img_001.png)

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。

如果你也在自己**跑模型、写代码、做项目**，

或者使用**Claude**和**Claude code**，

欢迎**点赞关注转发**一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。当然你也可以简单粗暴的甩给我999元，我拉你进群，这个没门槛。

![](images/c8e31f/img_002.jpg)
