视觉、图像生成与实时语音模型
分别配置图像输入、图像生成路由和 DashScope Live Voice。
图像输入、图像生成与实时语音是三种不同能力。一个模型支持看图,不意味着它能生成图片;Live Voice 专用路由也不参与普通聊天选择。
视觉输入与完整轮次
capabilities.vision: true 声明视觉能力。若模型还能遵循 Agent 策略并调用工具,可同时声明 capabilities.agent: true。
文本主模型采用这样的视觉 fallback 时,包含图片的整个轮次会保持同一 provider、模型和端点,包括工具调用与重试;下一独立轮次返回主模型。每次请求仅携带目标模型支持的媒体类型。
不声明 agent 或设为 false 时,保留 Vision Bridge 的转录流程,不进入完整 Agent 轮次路由。
图像生成
supportsImageGeneration: true 将路由提供给内置 image_gen 工具。专用图像路由再加 imageOnly: true,使其不出现在普通模型选择器。旧配置只用 imageOnly 也仍隐含图像生成能力。
兼具聊天与生成图片能力的路由不设 imageOnly,可作为主模型及 /model --image 的选择。
生成图片的路由必须显式声明 HTTPS baseUrl 和非空 envKey。图像与聊天共用该路由的地址及凭据;如果两者需要不同地址或 Key,应配置两条路由。
Live Voice 专用路由
DashScope Realtime 语音到语音路由设置 realtimeOnly: true。它不出现在 chat、fast、vision、voice 或 image 选择器,只由 experimental.liveVoice.model 选择。
{
"modelProviders": {
"openai": [
{
"id": "qwen3.5-omni-plus-realtime",
"baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",
"envKey": "DASHSCOPE_API_KEY",
"realtimeOnly": true
}
]
},
"experimental": {
"liveVoice": {
"enabled": true,
"model": "qwen3.5-omni-plus-realtime",
"voice": "Tina"
}
}
}这是官方配置示例,模型和声音可用性依实际服务。路由需声明 baseUrl 与 envKey,使用 DashScope 主机;地址会转换为对应 wss://<host>/api-ws/v1/realtime。
Live Voice 只读取用户与系统配置,不读取 workspace 设置;项目 .qwen/settings.json 不能新增或重定向语音路由。
独立配置与回退
多个 provider 有同名模型时可用 provider:modelId。裸 modelId 未匹配 realtimeOnly 路由时,沿用独立的 liveVoice.endpoint/apiKey;带 provider 的选择器若 provider 存在却没有路由,则报错,不静默换用存储 Key。
选择路由后,独立 endpoint/apiKey 不使用,setup API 也拒绝保存新的独立值。该路由 Key 先取进程环境,再取 settings 的 env。
独立路径支持与 Key 区域一致的 DashScope 或 *.maas.aliyuncs.com 地址,空地址默认北京;其他区域 Key 因地址错配可能返回 401。Live Voice 开启时,新端点需完成 Realtime handshake 后才保存。