Skip to content
FunCoding

Search

Search docs, Skills and MCP

Token 缓存与用量观察

了解哪些认证方式支持上下文缓存,并从统计中判断实际命中。

This page has not been translated into English yet. The original Chinese version is shown below.

Token 缓存复用先前系统指令与上下文,减少后续请求重复处理的 token。官方说明 Gemini CLI 自动使用该优化,但是否命中应看实际统计。

支持范围

Gemini API key 和配置了项目、位置的 Vertex AI 用户支持缓存。OAuth 的 Google Personal/Enterprise 登录通过 Code Assist API;官方专页当前说明该接口不支持创建 cached content。

这里 Vertex AI 是独立支持项,不能因为文章开头提到 API key 就推断 ADC 认证的 Vertex 一定不支持。

查看统计

会话中运行 /stats,有缓存 token 时会显示相关用量和节省。没有显示不等于模型没有读取上下文,也不能仅根据提示重复就假定缓存已经生效。

与费用及上下文区分

缓存优化 API 的重复处理,不替代压缩或删除不必要上下文,也不保证每次请求固定比例节省。费用与额度仍依认证和套餐,见额度与价格。

官方专页未提供可承诺的固定命中率、缓存时长或节省百分比,本页不补造这些值。