
降低 API 费用
混用模型 + 控制上下文长度,比无脑用最强模型省 3-4 倍费用。
技巧 1:不同任务用不同模型
Section titled “技巧 1:不同任务用不同模型”探索、搜索代码不需要强推理,便宜模型完全够用。只在真正需要深度思考时才上强的。
| 任务类型 | 推荐档位 | 说明 |
|---|---|---|
| 探索(搜代码、读文件、理解结构) | haiku 档 | 便宜,看代码说结论就行 |
| 规划 & 执行(设计、写代码) | sonnet 档或更强 | 需要全局思维和多约束判断 |
| 审查(检查代码改动) | 与执行不同的档位 | 换视角更容易发现盲区 |
技巧 2:Subagent 默认走便宜档位
Section titled “技巧 2:Subagent 默认走便宜档位”这是省钱的大头。子代理做探索、审查、网络搜索这些活儿时,默认就走便宜档位。Peri 内置的 subagent 已经按档位配好,你不用管:
| 内置子代理 | 默认模型档位 |
|---|---|
| explorer(代码探索)、web-researcher(网络研究) | haiku 档(最便宜) |
| coder(编码)、verification(验证) | sonnet 档(均衡) |
| plan(方案设计)、general-purpose(通用) | inherit(跟随主会话档位) |
你只需要记住:给 subagent 的任务本来就是轻量的,没必要烧贵模型。
技巧 3:及时 /compact
Section titled “技巧 3:及时 /compact”消息数攒到 200+ 条,每发一句都在为前面所有历史买单。用 /compact 把冗长对话压成结构化摘要:
/compact摘要保留关键决策、改动清单、TRAP 记录,丢掉中间试错过程。什么时候该 compact:
- 消息数 200+ 条
- 回复明显变慢
- 看着账单肉疼
- 一个会话跨了好几个任务
技巧 4:CLAUDE.md 别写太长
Section titled “技巧 4:CLAUDE.md 别写太长”CLAUDE.md 是会话基础,每轮对话都得带上它。500 行废话版和 50 行精炼版,每个会话下来差几千 tokens。精简的 CLAUDE.md 不止省钱——代理真能读完、能记住,效果更好。
砍掉没人看的背景故事、项目哲学、重复规则。只留代理真正需要知道的。