跳到正文
FunCoding

搜索

搜索文档、Skill 和 MCP

Token 缓存与成本读数

查看输入缓存命中,并区分降低前缀价格与减少常驻上下文。

Token caching 可复用重复请求前缀,例如系统指令与对话历史。Qwen 官方将该优化描述为 API key 路径上的自动行为,不需要额外开启缓存设置。

如何检查

运行 /stats 查看缓存 token 数和占输入的比例。有实际缓存命中时才显示相关读数;不要把文档截图中的某个百分比当作当前会话保证。

Qwen API key 和 OpenAI 兼容提供商属于文档说明范围,但具体命中、延迟与计费仍取决于实际提供商返回用量和价格。缓存读数缺失不等于所有输入免费,也不能直接用 token 比例推算所有模型的费用折扣。

缓存和缩小前缀可以同时做

缓存降低重复前缀的处理成本;减少常驻工具声明、过大的上下文文件则减少前缀本身。后者见上下文成本。

比较优化时同时看新会话输入量、缓存命中以及完整任务用量,不只看窗口占用百分比。不要为了提高命中保留无关信息,也不要假设更换工具集合或系统上下文后仍命中同一前缀。

官方缓存页仍对比旧 OAuth 行为,本页不把该历史描述当作当前主模型 OAuth 登录可用性的承诺;认证方式见登录配置。