辅助模型与请求超时
配置 fast、advisor、vision、compaction 与回退路由,区分请求和流超时。
This page has not been translated into English yet. The original Chinese version is shown below.
辅助模型可为不同任务选择独立路由;跨提供商选择意味着相关文本或媒体可能发往该提供商。模型必须在目录中有可解析的配置,不能只填一个不存在的名称。
模型角色
| 字段 | 用途与未设行为 |
|---|---|
| fastModel | 建议、推测执行及 Auto 分类等快速任务;为空使用主模型;/model --fast |
| advisorModel | /advisor 第二意见;为空使用主模型,选择其他提供商会发送最近会话 |
| visionModel | 文本模型收到图片或 PDF 视觉回退时转录;未设自动选择同提供商视觉模型;/model --vision |
| compactionModel | 会话压缩;未设使用主模型;/model --compaction 可设置或清除 |
| imageModel | image_gen;未设工具不可用;/model --image |
| voiceModel | 语音转录;未设无法启用听写;/model --voice |
imageModel 路由还需 supportsImageGeneration(或旧 imageOnly)、HTTPS baseUrl 和 envKey,见媒体模型。显式 visionModel 授权使用该模型,即使跨提供商,工具显示会披露端点。
visionBridgeTimeoutMs 未设时单次尝试 30 秒,超时可用新窗口重试一次。显式值为不超过 2147483647 的正整数毫秒。
modelFallbacks 是最多 3 个逗号分隔模型 ID,按顺序应对 429/503/529 容量错误;--fallback-model 可覆盖,修改需重启。它不表示对所有错误都无条件换模型。
请求与流的三种计时
| 控制 | 默认 | 说明 |
|---|---|---|
| generationConfig.timeout | 120000ms | 单请求超时,也可用 QWEN_CODE_API_TIMEOUT_MS;0 禁用 |
| generationConfig.streamIdleTimeoutMs | 240000ms | 两个流 chunk 之间的空闲;显式值优先 QWEN_STREAM_IDLE_TIMEOUT_MS;0 禁用 |
| QWEN_STREAM_MAX_LIFETIME_MS | 900000ms | 单个响应累计等待上游的时间,不因持续滴流而重置;0 禁用 |
流保护适用于 OpenAI 兼容和 Anthropic,官方说明 Gemini generator 未实现这两项流保护。streamMaxLifetimeMs 不能写入 settings.json 生效;嵌入式开发可用 ContentGeneratorConfig,普通用户使用环境变量。
只延长或关闭 idle 不会取消 15 分钟 lifetime。提供商模型的 generationConfig 必须写在对应条目,顶层 model.generationConfig 不会填补缺项。
输出和媒体兼容
未显式设置 samplingParams.max_tokens 或 QWEN_CODE_MAX_OUTPUT_TOKENS 时,通常使用模型声明输出上限,并可能在触顶后提高额度再续接;显式输出上限会关闭自动提高。
OpenAI 兼容协议设置 samplingParams 时按原字段发送,不再自动合成 max_tokens,可用于 max_completion_tokens 等服务专用字段。
splitToolMedia 默认 true,将工具返回图片等媒体移到后续 user 消息;toolResultContentFormat 默认 parts,仅旧运行时不识别文本 parts 时才改为 string,两者控制的不是同一件事。
DashScope 的 enableRequestMetadata 未设时按 qwen 系列自动判断;辅助模型按自己的 provider 条目决定,不继承主模型显式值。未在 modelProviders 中找到的 fastModel 不会使用,而是回到主模型配置。