Token 缓存与用量观察
了解哪些认证方式支持上下文缓存,并从统计中判断实际命中。
Token 缓存复用先前系统指令与上下文,减少后续请求重复处理的 token。官方说明 Gemini CLI 自动使用该优化,但是否命中应看实际统计。
支持范围
Gemini API key 和配置了项目、位置的 Vertex AI 用户支持缓存。OAuth 的 Google Personal/Enterprise 登录通过 Code Assist API;官方专页当前说明该接口不支持创建 cached content。
这里 Vertex AI 是独立支持项,不能因为文章开头提到 API key 就推断 ADC 认证的 Vertex 一定不支持。
查看统计
会话中运行 /stats,有缓存 token 时会显示相关用量和节省。没有显示不等于模型没有读取上下文,也不能仅根据提示重复就假定缓存已经生效。
与费用及上下文区分
缓存优化 API 的重复处理,不替代压缩或删除不必要上下文,也不保证每次请求固定比例节省。费用与额度仍依认证和套餐,见额度与价格。
官方专页未提供可承诺的固定命中率、缓存时长或节省百分比,本页不补造这些值。