跳到正文
FunCoding

搜索

搜索文档、Skill 和 MCP

视觉、图像生成与实时语音模型

分别配置图像输入、图像生成路由和 DashScope Live Voice。

图像输入、图像生成与实时语音是三种不同能力。一个模型支持看图,不意味着它能生成图片;Live Voice 专用路由也不参与普通聊天选择。

视觉输入与完整轮次

capabilities.vision: true 声明视觉能力。若模型还能遵循 Agent 策略并调用工具,可同时声明 capabilities.agent: true。

文本主模型采用这样的视觉 fallback 时,包含图片的整个轮次会保持同一 provider、模型和端点,包括工具调用与重试;下一独立轮次返回主模型。每次请求仅携带目标模型支持的媒体类型。

不声明 agent 或设为 false 时,保留 Vision Bridge 的转录流程,不进入完整 Agent 轮次路由。

图像生成

supportsImageGeneration: true 将路由提供给内置 image_gen 工具。专用图像路由再加 imageOnly: true,使其不出现在普通模型选择器。旧配置只用 imageOnly 也仍隐含图像生成能力。

兼具聊天与生成图片能力的路由不设 imageOnly,可作为主模型及 /model --image 的选择。

生成图片的路由必须显式声明 HTTPS baseUrl 和非空 envKey。图像与聊天共用该路由的地址及凭据;如果两者需要不同地址或 Key,应配置两条路由。

Live Voice 专用路由

DashScope Realtime 语音到语音路由设置 realtimeOnly: true。它不出现在 chat、fast、vision、voice 或 image 选择器,只由 experimental.liveVoice.model 选择。

{
  "modelProviders": {
    "openai": [
      {
        "id": "qwen3.5-omni-plus-realtime",
        "baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",
        "envKey": "DASHSCOPE_API_KEY",
        "realtimeOnly": true
      }
    ]
  },
  "experimental": {
    "liveVoice": {
      "enabled": true,
      "model": "qwen3.5-omni-plus-realtime",
      "voice": "Tina"
    }
  }
}

这是官方配置示例,模型和声音可用性依实际服务。路由需声明 baseUrl 与 envKey,使用 DashScope 主机;地址会转换为对应 wss://<host>/api-ws/v1/realtime。

Live Voice 只读取用户与系统配置,不读取 workspace 设置;项目 .qwen/settings.json 不能新增或重定向语音路由。

独立配置与回退

多个 provider 有同名模型时可用 provider:modelId。裸 modelId 未匹配 realtimeOnly 路由时,沿用独立的 liveVoice.endpoint/apiKey;带 provider 的选择器若 provider 存在却没有路由,则报错,不静默换用存储 Key。

选择路由后,独立 endpoint/apiKey 不使用,setup API 也拒绝保存新的独立值。该路由 Key 先取进程环境,再取 settings 的 env。

独立路径支持与 Key 区域一致的 DashScope 或 *.maas.aliyuncs.com 地址,空地址默认北京;其他区域 Key 因地址错配可能返回 401。Live Voice 开启时,新端点需完成 Realtime handshake 后才保存。