Token 缓存与成本读数
查看输入缓存命中,并区分降低前缀价格与减少常驻上下文。
This page has not been translated into English yet. The original Chinese version is shown below.
Token caching 可复用重复请求前缀,例如系统指令与对话历史。Qwen 官方将该优化描述为 API key 路径上的自动行为,不需要额外开启缓存设置。
如何检查
运行 /stats 查看缓存 token 数和占输入的比例。有实际缓存命中时才显示相关读数;不要把文档截图中的某个百分比当作当前会话保证。
Qwen API key 和 OpenAI 兼容提供商属于文档说明范围,但具体命中、延迟与计费仍取决于实际提供商返回用量和价格。缓存读数缺失不等于所有输入免费,也不能直接用 token 比例推算所有模型的费用折扣。
缓存和缩小前缀可以同时做
缓存降低重复前缀的处理成本;减少常驻工具声明、过大的上下文文件则减少前缀本身。后者见上下文成本。
比较优化时同时看新会话输入量、缓存命中以及完整任务用量,不只看窗口占用百分比。不要为了提高命中保留无关信息,也不要假设更换工具集合或系统上下文后仍命中同一前缀。
官方缓存页仍对比旧 OAuth 行为,本页不把该历史描述当作当前主模型 OAuth 登录可用性的承诺;认证方式见登录配置。