Skip to content
FunCoding

Search

Search docs, Skills and MCP

Token 缓存与成本读数

查看输入缓存命中,并区分降低前缀价格与减少常驻上下文。

This page has not been translated into English yet. The original Chinese version is shown below.

Token caching 可复用重复请求前缀,例如系统指令与对话历史。Qwen 官方将该优化描述为 API key 路径上的自动行为,不需要额外开启缓存设置。

如何检查

运行 /stats 查看缓存 token 数和占输入的比例。有实际缓存命中时才显示相关读数;不要把文档截图中的某个百分比当作当前会话保证。

Qwen API key 和 OpenAI 兼容提供商属于文档说明范围,但具体命中、延迟与计费仍取决于实际提供商返回用量和价格。缓存读数缺失不等于所有输入免费,也不能直接用 token 比例推算所有模型的费用折扣。

缓存和缩小前缀可以同时做

缓存降低重复前缀的处理成本;减少常驻工具声明、过大的上下文文件则减少前缀本身。后者见上下文成本。

比较优化时同时看新会话输入量、缓存命中以及完整任务用量,不只看窗口占用百分比。不要为了提高命中保留无关信息,也不要假设更换工具集合或系统上下文后仍命中同一前缀。

官方缓存页仍对比旧 OAuth 行为,本页不把该历史描述当作当前主模型 OAuth 登录可用性的承诺;认证方式见登录配置。