跳到正文
FunCoding

搜索

搜索文档、Skill 和 MCP

通过上下文和缓存减少用量

在相关任务中保留有效上下文,在切换问题时清理会话并避免不必要的缓存失效。

一次 Chat 请求不只处理新输入,也可能处理相关历史、文件和工具结果。较长会话可能增加每次调用的输入 token,但“总是新建对话”也会丢掉仍有用的上下文,应按任务是否连续决定。

继续还是新开

修改同一段生成代码、追踪同一个错误、迭代同一方案时,继续原会话能减少重复解释。换到无关功能、文档或发布任务,旧历史已无帮助时,再开新会话。

CLI 可用 /new 或 /clear 开始新的会话上下文。需要继续长任务时,可运行 /compact 汇总历史,也可明确关注范围,例如 /compact focus on the auth module。/context 用于检查当前占用,详见CLI 上下文。

不要把优化教程中“长会话带上全部历史”的概括理解为每个客户端每次都会原样发送所有历史;实际压缩和上下文管理以对应客户端行为为准。

减少无用输入

提供明确任务、已知相关文件和完成条件,帮助 agent 少做重复探索。用精简的 AGENTS.md 或 .github/copilot-instructions.md 给出项目结构和必要约定;只启用当前任务需要的工具集,避免将整套无关 MCP 工具描述长期放入上下文。

这些做法减少无效输入,但不意味着指令越少越好。构建、测试命令和已知陷阱仍应保留,否则错误重试也会消耗额度。

避免不必要的缓存重建

官方优化教程列出几类会令缓存失效的操作:会话中途切换模型,改变 reasoning effort 或上下文大小,修改启用的工具或 MCP servers,以及缓存过期后恢复旧会话。

因此可以在开始前选定合适模型与工具,相关任务中保持配置稳定。Auto 会在自然缓存边界路由,例如新会话或 /compact 之后,也可能在质量收益超过缓存损失时改路由;不能把 Auto 当作永不换模型。

缓存费用和期限不是统一值

优化教程概括缓存输入通常约为普通输入单价的 10%,但当前价格表有其他比例,例如 GPT-6.1 Sol 默认档缓存输入为 0.10 美元、普通输入为 2.00 美元,每百万 token 比例是 5%。实际估算应逐模型查价格表。

教程还给出 OpenAI 模型不活跃 24 小时、其他多数模型 1 小时的缓存期限说明。这是该教程的指导,不是所有提供商、模型或未来版本统一的保证。间隔较久再继续 CLI 长任务时,可先 compact,使重建时只带必要摘要。