# 如何把 Fable 5 的每一个 token 都花在刀刃上

> 龙虾AGI通用实验室 · 2026-07-03

## Fable 5 回来了，但得省着用

7 月 1 日 Fable 5 重新上线，但这次有三道限制：只开放 7 天（到 7 月 7 日），只能用每周订阅额度的 50%，消耗速度是其他 Claude 模型的两倍。

三个约束叠加，实际可用量非常有限。我之前写过《大模型缓存机制完全指南》，聊了 KV 缓存和前缀匹配的底层原理。那套机制在 Fable 5 上尤其关键，理解缓存能让你不浪费每一个Fable token。

## Fable 5 为什么特别容易踩缓存的坑

Fable 5 擅长长时间自主运行，一个任务可以自己规划、自己验证、持续推进，所以特别烧 token。5 小时的额度窗口，按双倍消耗速度算，可能一两个小时就用光了。

这带来一个结构性的矛盾：任务跑到一半，token 耗尽，被迫停下，既没跑完也来不及 compact。等额度恢复往往已经过了 1 小时的缓存 TTL，下次启动就是全价冷启动。

长任务最需要缓存连续命中，但额度限制恰好让缓存最容易断裂。知道了问题在哪，下面按使用阶段聊怎么应对。

## 使用中：保护好你的缓存

**对话间隔不要超过 1 小时。** 订阅用户的缓存 TTL 是 1 小时，每次命中都会重置计时器。只要你持续在用，哪怕每隔十几分钟发一条消息，缓存就不会过期。真正让缓存过期的不是"用了太久"，而是"中间停了太久"。

**开头就定好 effort 级别，中途不要切。** 很多人以为同一个模型切 effort 没有成本。实际上 effort 级别会改变系统提示词中的推理指令，也就是请求序列靠前位置的 token 变了。回到《缓存指南》里的核心规则：前面的 token 变了，后面所有缓存全部作废。跟改 CLAUDE.md 是同一类问题。

![](images/e91c52/img_001.png)

Claude Code 自己也知道这个代价，中途切 effort 时会弹出确认对话框提醒缓存会失效。看到这个提示就该知道，这一切换是有成本的。

## 用完时：趁缓存还在赶紧 compact

如果你预判下次使用要超过 1 小时（比如额度快用光了，恢复要好几个小时），应该在这轮结束前立刻 compact，不要等到下次。

原因很简单：compact 本身就是一次 API 调用，输入是完整上下文。缓存命中时按 10% 计费，过期后全价。

用数字感受差距。假设上下文 380k token：

场景	compact 输入成本	摘要输出	总消耗（等价 token）

缓存命中时 compact	38k（380k × 10%）	~15k	~53k

缓存过期后 compact	380k（全价）	~15k	~395k

同样的操作，差了将近 8 倍。这 8 倍花的全是 Fable 5 最金贵的额度。

还有一种更坑的情况：Fable 跑着跑着额度突然用光，被迫停止，连 compact 的机会都没有。任务没跑完，上下文没压缩，等额度恢复时缓存早就过期了。这种情况怎么办？

## 50% 额度限制反而打开了新玩法

50% 的限制意味着另外 50% 额度只能给其他模型用。换个角度看，这反而给了你"分工协作"的空间。

## 玩法一：双窗口分工

开两个 Claude Code 窗口。一个挂 Fable 5 专门啃硬骨头（复杂架构决策、大型重构、长任务规划），另一个挂 Opus 4.6 或 Sonnet 处理常规工作（简单 bug、格式调整、写文档）。

Fable 的 50% 额度只花在真正需要它能力上限的地方，日常任务不动它一个 token。

## 玩法二：跨模型 compact

针对的是上一节说的困境：上下文很长，缓存已经过期，需要 compact 但不想让 Fable 全价读取 380k。

做法是先切到 Sonnet，让 Sonnet 全价读取并生成摘要（消耗 Sonnet 额度），然后切回 Fable。此时 Fable 冷启动读取的不是原来的 380k，而是压缩后的大约 43k（系统提示 + 工具定义 + 摘要）。

算一下账：

	Fable 消耗	Sonnet 消耗

直接用 Fable compact	~395k	0

切 Sonnet compact 再切回	~43k	~395k

Fable 省下约 337k，代价是 Sonnet 多花约 395k。Sonnet 的额度远没有 Fable 金贵，这笔交易对珍惜 Fable 额度的人来说很划算。

不过也有取舍。如果你整体 token 预算也紧张，可能切换也不划算。另外 Sonnet 的摘要质量可能不如 Fable，任务上下文特别复杂时需要注意。

## 玩法三：把压缩外包给 ChatGPT

最极端的方案，适合 Pro 用户这种额度特别少的情况。

Pro 的额度跑 Fable 基本撑不完一个复杂任务。每次 5 小时额度用光，任务没完成，等额度恢复必然超过 1 小时，缓存过期。不管用 Fable 还是 Sonnet 来 compact 都要消耗 Claude 的额度。

那就彻底外包：用 /export 导出上下文，复制到 ChatGPT 让它生成压缩摘要，然后回到 Claude 开新窗口把摘要发过去继续工作。ChatGPT 量大管饱，这个操作对 Fable 额度零消耗。

## 希望大家都不浪费这 7 天

Fable 5 这次只开放 7 天。上一次开放了 3 天就因为出口管制被紧急下架，这次能用多久、下次什么时候再开放，没人知道。

所有省 token 的策略，归根结底都是《大模型缓存机制完全指南》里那条规则的推论：从第一个 token 开始比对，遇到不同就停，后面全部重算。Fable 5 的稀缺只是把"保护缓存"的重要性放大了好几倍。

希望大家都能在这有限的窗口里把 Fable 5 用好、用满，一个 token 都不浪费。

我建了一个AI学习研究群，目前几十来人，都是在真正动手搞AI的人。如果你也在自己跑模型、写代码、做项目，欢迎点赞关注转发一键三连，然后加我微信，备注写清"你在做的AI方向"，聊得来的话我拉你进群。纯围观的和小白就不加了，有一定门槛。

![](images/e91c52/img_002.jpg)
