在上一篇文章中,我们完成了 OpenClaw 的模型…
📉 三、关键省心技巧:缓存命中
你觉得贵,很可能是因为没有充分利用 DeepSeek 的 “缓存命中” 机制。
原理:
当你发送的请求前缀(如系统提示词、项目背景描述)和之前的请求高度重复时,这部分输入不会被重复计费。
| 场景 | 未命中缓存 | 命中缓存 | 节省 |
| — | — | — | — |
| 输入价格 | 1元 / 1M tokens | 0.02元 / 1M tokens | 98% |
如何提高缓存命中率:
复用系统提示词:在 OpenClaw 中设置固定的 system_prompt,每次请求都会复用
固定项目背景:在同一个会话中,项目背景描述只需在开头提供一次,后续对话会复用前缀
保持会话连贯:不要在每次提问时重复粘贴大段代码,而是使用 @file 引用或保持会话上下文
OpenClaw 中的配置:
{
“agents”: {
“defaults”: {
“systemPrompt”: “你是嵌入式软件工程师,使用 C/STM32 开发…”,
“compaction”: {
“keepRecentTokens”: 8000
}
}
}
}
bash
保持 keepRecentTokens 足够大(如 8000),可以让系统提示词和项目背景始终保持在前缀中,最大化缓存命中。
💡 四、终极省钱策略:混合模型工作流
你感觉“贵”的核心矛盾其实是:把最适合执行重复性任务的“快枪手”V4-Flash,用在了需要深度思考的“总工程师”岗位上。
一个更经济、高效的方法是 “混合模型工作流”:
┌─────────────────────────────────────────────────────────────────┐
│ 混合模型工作流 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ 用户需求 │
│ ↓ │
│ ┌─────────────────────┐ │
│ │ V4-Pro(规划) │ ← 架构设计、需求分析、代码审查 │
│ │ 价格:3元/6元 │ ← 需要深度推理的任务 │
│ └─────────────────────┘ │
│ ↓ │
│ ┌─────────────────────┐ │
│ │ V4-Flash(执行) │ ← 代…