Skip to content
FunCoding

Search

Search docs, Skills and MCP

通过上下文和缓存减少用量

在相关任务中保留有效上下文,在切换问题时清理会话并避免不必要的缓存失效。

This page has not been translated into English yet. The original Chinese version is shown below.

一次 Chat 请求不只处理新输入,也可能处理相关历史、文件和工具结果。较长会话可能增加每次调用的输入 token,但“总是新建对话”也会丢掉仍有用的上下文,应按任务是否连续决定。

继续还是新开

修改同一段生成代码、追踪同一个错误、迭代同一方案时,继续原会话能减少重复解释。换到无关功能、文档或发布任务,旧历史已无帮助时,再开新会话。

CLI 可用 /new 或 /clear 开始新的会话上下文。需要继续长任务时,可运行 /compact 汇总历史,也可明确关注范围,例如 /compact focus on the auth module。/context 用于检查当前占用,详见CLI 上下文。

不要把优化教程中“长会话带上全部历史”的概括理解为每个客户端每次都会原样发送所有历史;实际压缩和上下文管理以对应客户端行为为准。

减少无用输入

提供明确任务、已知相关文件和完成条件,帮助 agent 少做重复探索。用精简的 AGENTS.md 或 .github/copilot-instructions.md 给出项目结构和必要约定;只启用当前任务需要的工具集,避免将整套无关 MCP 工具描述长期放入上下文。

这些做法减少无效输入,但不意味着指令越少越好。构建、测试命令和已知陷阱仍应保留,否则错误重试也会消耗额度。

避免不必要的缓存重建

官方优化教程列出几类会令缓存失效的操作:会话中途切换模型,改变 reasoning effort 或上下文大小,修改启用的工具或 MCP servers,以及缓存过期后恢复旧会话。

因此可以在开始前选定合适模型与工具,相关任务中保持配置稳定。Auto 会在自然缓存边界路由,例如新会话或 /compact 之后,也可能在质量收益超过缓存损失时改路由;不能把 Auto 当作永不换模型。

缓存费用和期限不是统一值

优化教程概括缓存输入通常约为普通输入单价的 10%,但当前价格表有其他比例,例如 GPT-6.1 Sol 默认档缓存输入为 0.10 美元、普通输入为 2.00 美元,每百万 token 比例是 5%。实际估算应逐模型查价格表。

教程还给出 OpenAI 模型不活跃 24 小时、其他多数模型 1 小时的缓存期限说明。这是该教程的指导,不是所有提供商、模型或未来版本统一的保证。间隔较久再继续 CLI 长任务时,可先 compact,使重建时只带必要摘要。