龙虾AGI通用实验室Lobster AGI Lab · est. 20262026 · 09 · 16
首页 / 文章 / 对AI的思考
对AI的思考

如何把 Fable 5 的每一个 token 都花在刀刃上

格里灰丝2026-07-03约 2463 字Markdown 原文

Fable 5 回来了,但得省着用

7 月 1 日 Fable 5 重新上线,但这次有三道限制:只开放 7 天(到 7 月 7 日),只能用每周订阅额度的 50%,消耗速度是其他 Claude 模型的两倍。

三个约束叠加,实际可用量非常有限。我之前写过《大模型缓存机制完全指南》,聊了 KV 缓存和前缀匹配的底层原理。那套机制在 Fable 5 上尤其关键,理解缓存能让你不浪费每一个Fable token。

Fable 5 为什么特别容易踩缓存的坑

Fable 5 擅长长时间自主运行,一个任务可以自己规划、自己验证、持续推进,所以特别烧 token。5 小时的额度窗口,按双倍消耗速度算,可能一两个小时就用光了。

这带来一个结构性的矛盾:任务跑到一半,token 耗尽,被迫停下,既没跑完也来不及 compact。等额度恢复往往已经过了 1 小时的缓存 TTL,下次启动就是全价冷启动。

长任务最需要缓存连续命中,但额度限制恰好让缓存最容易断裂。知道了问题在哪,下面按使用阶段聊怎么应对。

使用中:保护好你的缓存

对话间隔不要超过 1 小时。 订阅用户的缓存 TTL 是 1 小时,每次命中都会重置计时器。只要你持续在用,哪怕每隔十几分钟发一条消息,缓存就不会过期。真正让缓存过期的不是"用了太久",而是"中间停了太久"。

开头就定好 effort 级别,中途不要切。 很多人以为同一个模型切 effort 没有成本。实际上 effort 级别会改变系统提示词中的推理指令,也就是请求序列靠前位置的 token 变了。回到《缓存指南》里的核心规则:前面的 token 变了,后面所有缓存全部作废。跟改 CLAUDE.md 是同一类问题。

Claude Code 自己也知道这个代价,中途切 effort 时会弹出确认对话框提醒缓存会失效。看到这个提示就该知道,这一切换是有成本的。

用完时:趁缓存还在赶紧 compact

如果你预判下次使用要超过 1 小时(比如额度快用光了,恢复要好几个小时),应该在这轮结束前立刻 compact,不要等到下次。

原因很简单:compact 本身就是一次 API 调用,输入是完整上下文。缓存命中时按 10% 计费,过期后全价。

用数字感受差距。假设上下文 380k token:

场景 compact 输入成本 摘要输出 总消耗(等价 token)

缓存命中时 compact 38k(380k × 10%) ~15k ~53k

缓存过期后 compact 380k(全价) ~15k ~395k

同样的操作,差了将近 8 倍。这 8 倍花的全是 Fable 5 最金贵的额度。

还有一种更坑的情况:Fable 跑着跑着额度突然用光,被迫停止,连 compact 的机会都没有。任务没跑完,上下文没压缩,等额度恢复时缓存早就过期了。这种情况怎么办?

50% 额度限制反而打开了新玩法

50% 的限制意味着另外 50% 额度只能给其他模型用。换个角度看,这反而给了你"分工协作"的空间。

玩法一:双窗口分工

开两个 Claude Code 窗口。一个挂 Fable 5 专门啃硬骨头(复杂架构决策、大型重构、长任务规划),另一个挂 Opus 4.6 或 Sonnet 处理常规工作(简单 bug、格式调整、写文档)。

Fable 的 50% 额度只花在真正需要它能力上限的地方,日常任务不动它一个 token。

玩法二:跨模型 compact

针对的是上一节说的困境:上下文很长,缓存已经过期,需要 compact 但不想让 Fable 全价读取 380k。

做法是先切到 Sonnet,让 Sonnet 全价读取并生成摘要(消耗 Sonnet 额度),然后切回 Fable。此时 Fable 冷启动读取的不是原来的 380k,而是压缩后的大约 43k(系统提示 + 工具定义 + 摘要)。

算一下账:

Fable 消耗    Sonnet 消耗

直接用 Fable compact ~395k 0

切 Sonnet compact 再切回 ~43k ~395k

Fable 省下约 337k,代价是 Sonnet 多花约 395k。Sonnet 的额度远没有 Fable 金贵,这笔交易对珍惜 Fable 额度的人来说很划算。

不过也有取舍。如果你整体 token 预算也紧张,可能切换也不划算。另外 Sonnet 的摘要质量可能不如 Fable,任务上下文特别复杂时需要注意。

玩法三:把压缩外包给 ChatGPT

最极端的方案,适合 Pro 用户这种额度特别少的情况。

Pro 的额度跑 Fable 基本撑不完一个复杂任务。每次 5 小时额度用光,任务没完成,等额度恢复必然超过 1 小时,缓存过期。不管用 Fable 还是 Sonnet 来 compact 都要消耗 Claude 的额度。

那就彻底外包:用 /export 导出上下文,复制到 ChatGPT 让它生成压缩摘要,然后回到 Claude 开新窗口把摘要发过去继续工作。ChatGPT 量大管饱,这个操作对 Fable 额度零消耗。

希望大家都不浪费这 7 天

Fable 5 这次只开放 7 天。上一次开放了 3 天就因为出口管制被紧急下架,这次能用多久、下次什么时候再开放,没人知道。

所有省 token 的策略,归根结底都是《大模型缓存机制完全指南》里那条规则的推论:从第一个 token 开始比对,遇到不同就停,后面全部重算。Fable 5 的稀缺只是把"保护缓存"的重要性放大了好几倍。

希望大家都能在这有限的窗口里把 Fable 5 用好、用满,一个 token 都不浪费。

我建了一个AI学习研究群,目前几十来人,都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目,欢迎点赞关注转发一键三连,然后加我微信,备注写清"你在做的AI方向",聊得来的话我拉你进群。纯围观的和小白就不加了,有一定门槛。

上一篇AI的第一性原理 | AI产品的广义圣维南原理下一篇当AI有了子目标,人类就有了灭亡的风险