我的 Claude 账号里有两种额度。Fable 的额度拿来写代码,基本上每个月都不够用,得精打细算。Opus 的额度拿来做问答和文字工作,情况完全相反:每周有一个使用上限,到期没用完就清零,下周重新开始。
Fable 不够用,这个没办法。但 Opus 用不完这件事,浪费了好几周之后就开始觉得可惜了。每到周末看一眼剩余额度,还有一大截,然后归零,下周又是满的,又用不完。
同一时间,周围陆续有朋友在问 Claude 怎么用、好不好用、值不值得折腾。问完之后真正去注册的没几个,大部分人卡在网络那一步就放弃了。这个事情也不好帮忙,每台设备的网络环境都不一样,远程指导半天也不一定搞得定。
我的额度在浪费,别人想用又用不上。这两件事拼在一起看,就有了一个想法:能不能把我用不完的 Opus 额度共享出去?
一个现成的条件
这个想法能落地,是因为有一个现成的条件。我有一台海外的服务器,上面之前就装好了 Claude Code,登着我自己的账号。Claude Code 本来是一个命令行工具,用来写代码的,但它的核心能力其实就是跟 Claude 模型对话。如果我在它前面搭一个网页界面,别人打开浏览器就能直接跟 Claude 聊天。
关键在于网络。服务器在海外,它跟 Claude 的通信是畅通的。用的人只需要能连上我的服务器就行,不需要自己去解决怎么连 Claude 的问题。网络这道坎,在服务器那一端就解决掉了。
这就是 chat.goutoujunshi.cn 的起点。一个很朴素的出发点:我有多余的额度,我有一台能连通的服务器,我可以做一个入口让别人也用上。对我来说额度不浪费了,对别人来说不用折腾网络了,双方都得到了好处。
为什么锁在 Opus 4.6
搭好之后第一个设计决定是选模型。Claude 这个系列后来陆续出了好几个版本,Opus 4.7、4.8、Opus 5 都有了。但这几个更新版本的发力方向都在代码能力上,编程任务确实越来越强,对话和文字方面的提升并不明显,有些场景下反而不如 4.6。
来我们这里用的人大概率不写代码。日常就是问问题、查资料、整理思路、帮忙梳理一些文档。这类场景下,Opus 4.6 是整个 Claude 系列里语言表达最稳、回答质量最高的一个版本。体感上,它更像一个真的在跟你交流的人。回答的方式像一个水平很高的朋友在帮你分析问题,有条理,有分寸,该展开的地方展开,该收的时候不啰嗦。
所以我们把模型固定在 Opus 4.6 上,不给选别的。与其让使用者在一堆版本号之间纠结,不如我们替大家做好这个判断。
现在在传 Opus 5.2 快出了。等出来之后会测一下问答效果,如果确实比 4.6 好,再考虑放出来。在那之前,4.6 就是我们的选择。
从"能用"到"跟官网一样"
第一版搭出来之后,基本功能没问题,能问能答,回复是流式输出的,打字效果和官网一样。但自己用了几轮就发现不少不舒服的地方。
比如回复过程中,如果 Claude 正在写一段代码,代码块的反引号还没闭合,页面上就会显示一段格式错乱的内容,要等整段写完才恢复正常。历史对话全部平铺在侧栏里,没有按日期分组,几天下来找一段旧对话要翻很久。余额也看不到,每条消息花了多少钱没有任何显示。
这些问题如果只是自己用,忍忍也行。但既然打算给别人用,细节就不能凑合了。于是开始一项一项补。
先补的是基础设施:注册和登录、余额显示和充值、一个像样的管理后台。然后是使用体验:对话按"今天""昨天""七天内"分组,每条回复下面显示费用,支持重新生成和从某一轮分叉出新对话。再然后是能力对齐:文件和图片上传、联网搜索、搜索结果带来源标签、数学公式渲染。
做着做着就产生了一个想法。claude.ai 官网能做到什么样,我们在技术上其实也都做得到。搜索结果有来源标签,点开能跳转到原文,这个能做。上传一份 PDF 或者 Excel 让 Claude 帮忙分析,这个也能做。回复里出现了一个数学公式,用 LaTeX 渲染出来而不是显示一串符号,这个同样能做。
既然做得到,为什么不就做到那个程度?
所以现在线上的版本,从功能和体验上来说,和 claude.ai 网页版已经非常接近了。界面风格、交互逻辑、排版细节,我们都在对标官网的标准。
后台的 Harness 工程优化
模型的能力是固定的,但围绕模型做的工程优化,直接影响回答质量和 token 消耗。这类工作行业里叫 Harness,我们在这一层花了不少功夫。
先说一个背景。Claude 的对话机制是每发一轮消息,之前所有的对话内容都要一起发过去,模型才能知道上下文在聊什么。对话越长,每一轮携带的上下文就越大,消耗的 token 就越多。Claude 本身有一套缓存机制,连续聊的时候,重复的上下文可以命中缓存,成本会低很多。但这个缓存有有效期,过期之后如果继续聊,就相当于把所有内容按全价重新算一遍。
官网的用户大概不需要关心这件事。但我们的额度是有限的,这笔账得管起来。我们做的事情是:当缓存过期或者上下文长到一定程度,系统会自动做一些操作,把 token 消耗控制住。对话不会断,Claude 还记得之前聊了什么,但不会因为缓存过期而突然产生一笔很大的开销。
另一个优化是在系统提示词层面。Claude 每次请求都会带一段系统提示词,告诉模型该怎么回答、遵守什么规则。官网的系统提示词有两万多字节,里面包含了大量只有 claude.ai 这个产品才需要的内容,比如套餐说明、API 文档引导、各种产品层面的策略。这些对我们的场景完全用不上,但每轮对话都会带上去,白白占 token。
我们根据自己的使用场景重写了系统提示词,去掉了所有跟我们无关的部分,只留下真正影响回答质量的规则。最终回答效果不变,每轮对话的固定开销减了将近一半。
这些优化对使用的人来说是完全傻瓜式的。不需要知道什么是 token,什么是缓存,什么时候该新开对话。我们把自己研究出来的这些东西都做进了后台的自动逻辑里,用的人正常聊就行。在这些细节上,我们其实比官网还做得细一些,因为我们确实花了时间在 Harness 这一层去研究和调整。
关于 token
我们的后台跑的就是我自己的 Claude 账号,每一条消息都是真实的 Opus 4.6 请求,token 是真的。每条消息消耗了多少输入 token、多少输出 token、有没有命中缓存、折算下来多少钱,在界面上都能看到明细。
来试试
地址:chat.goutoujunshi.cn
注册需要邀请码,名额有限,先到先得。现在还是试水阶段,欢迎大家来体验。
我们的新产品也已经整合到我们的主页上了:goutoujunshi.cn

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。
如果你也在自己跑模型、写代码、做项目,
或者使用Claude和Claude code,
欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。当然你也可以简单粗暴的甩给我999元,我拉你进群,这个没门槛。
