Skip to content
FunCoding

Search

Search docs, Skills and MCP

视觉、图像生成与实时语音模型

分别配置图像输入、图像生成路由和 DashScope Live Voice。

This page has not been translated into English yet. The original Chinese version is shown below.

图像输入、图像生成与实时语音是三种不同能力。一个模型支持看图,不意味着它能生成图片;Live Voice 专用路由也不参与普通聊天选择。

视觉输入与完整轮次

capabilities.vision: true 声明视觉能力。若模型还能遵循 Agent 策略并调用工具,可同时声明 capabilities.agent: true。

文本主模型采用这样的视觉 fallback 时,包含图片的整个轮次会保持同一 provider、模型和端点,包括工具调用与重试;下一独立轮次返回主模型。每次请求仅携带目标模型支持的媒体类型。

不声明 agent 或设为 false 时,保留 Vision Bridge 的转录流程,不进入完整 Agent 轮次路由。

图像生成

supportsImageGeneration: true 将路由提供给内置 image_gen 工具。专用图像路由再加 imageOnly: true,使其不出现在普通模型选择器。旧配置只用 imageOnly 也仍隐含图像生成能力。

兼具聊天与生成图片能力的路由不设 imageOnly,可作为主模型及 /model --image 的选择。

生成图片的路由必须显式声明 HTTPS baseUrl 和非空 envKey。图像与聊天共用该路由的地址及凭据;如果两者需要不同地址或 Key,应配置两条路由。

Live Voice 专用路由

DashScope Realtime 语音到语音路由设置 realtimeOnly: true。它不出现在 chat、fast、vision、voice 或 image 选择器,只由 experimental.liveVoice.model 选择。

{
  "modelProviders": {
    "openai": [
      {
        "id": "qwen3.5-omni-plus-realtime",
        "baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",
        "envKey": "DASHSCOPE_API_KEY",
        "realtimeOnly": true
      }
    ]
  },
  "experimental": {
    "liveVoice": {
      "enabled": true,
      "model": "qwen3.5-omni-plus-realtime",
      "voice": "Tina"
    }
  }
}

这是官方配置示例,模型和声音可用性依实际服务。路由需声明 baseUrl 与 envKey,使用 DashScope 主机;地址会转换为对应 wss://<host>/api-ws/v1/realtime。

Live Voice 只读取用户与系统配置,不读取 workspace 设置;项目 .qwen/settings.json 不能新增或重定向语音路由。

独立配置与回退

多个 provider 有同名模型时可用 provider:modelId。裸 modelId 未匹配 realtimeOnly 路由时,沿用独立的 liveVoice.endpoint/apiKey;带 provider 的选择器若 provider 存在却没有路由,则报错,不静默换用存储 Key。

选择路由后,独立 endpoint/apiKey 不使用,setup API 也拒绝保存新的独立值。该路由 Key 先取进程环境,再取 settings 的 env。

独立路径支持与 Key 区域一致的 DashScope 或 *.maas.aliyuncs.com 地址,空地址默认北京;其他区域 Key 因地址错配可能返回 401。Live Voice 开启时,新端点需完成 Realtime handshake 后才保存。