# 视觉、图像生成与实时语音模型

> 分别配置图像输入、图像生成路由和 DashScope Live Voice。

- 网址：https://funcoding.ai/agents/qwen-code/configuration/media-models/
- 核实日期：2026-10-08（命令、配置和价格以官方文档为准）
- 官方来源：[Qwen Code 官方文档：Model Providers](https://github.com/QwenLM/qwen-code/blob/main/docs/users/configuration/model-providers.md)

---
图像输入、图像生成与实时语音是三种不同能力。一个模型支持看图，不意味着它能生成图片；Live Voice 专用路由也不参与普通聊天选择。

## 视觉输入与完整轮次

`capabilities.vision: true` 声明视觉能力。若模型还能遵循 Agent 策略并调用工具，可同时声明 `capabilities.agent: true`。

文本主模型采用这样的视觉 fallback 时，包含图片的整个轮次会保持同一 provider、模型和端点，包括工具调用与重试；下一独立轮次返回主模型。每次请求仅携带目标模型支持的媒体类型。

不声明 agent 或设为 false 时，保留 Vision Bridge 的转录流程，不进入完整 Agent 轮次路由。

## 图像生成

`supportsImageGeneration: true` 将路由提供给内置 image_gen 工具。专用图像路由再加 `imageOnly: true`，使其不出现在普通模型选择器。旧配置只用 imageOnly 也仍隐含图像生成能力。

兼具聊天与生成图片能力的路由不设 imageOnly，可作为主模型及 `/model --image` 的选择。

生成图片的路由必须显式声明 HTTPS baseUrl 和非空 envKey。图像与聊天共用该路由的地址及凭据；如果两者需要不同地址或 Key，应配置两条路由。

## Live Voice 专用路由

DashScope Realtime 语音到语音路由设置 `realtimeOnly: true`。它不出现在 chat、fast、vision、voice 或 image 选择器，只由 `experimental.liveVoice.model` 选择。

```json
{
  "modelProviders": {
    "openai": [
      {
        "id": "qwen3.5-omni-plus-realtime",
        "baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",
        "envKey": "DASHSCOPE_API_KEY",
        "realtimeOnly": true
      }
    ]
  },
  "experimental": {
    "liveVoice": {
      "enabled": true,
      "model": "qwen3.5-omni-plus-realtime",
      "voice": "Tina"
    }
  }
}
```

这是官方配置示例，模型和声音可用性依实际服务。路由需声明 baseUrl 与 envKey，使用 DashScope 主机；地址会转换为对应 `wss://<host>/api-ws/v1/realtime`。

Live Voice 只读取用户与系统配置，不读取 workspace 设置；项目 `.qwen/settings.json` 不能新增或重定向语音路由。

## 独立配置与回退

多个 provider 有同名模型时可用 `provider:modelId`。裸 modelId 未匹配 realtimeOnly 路由时，沿用独立的 liveVoice.endpoint/apiKey；带 provider 的选择器若 provider 存在却没有路由，则报错，不静默换用存储 Key。

选择路由后，独立 endpoint/apiKey 不使用，setup API 也拒绝保存新的独立值。该路由 Key 先取进程环境，再取 settings 的 env。

独立路径支持与 Key 区域一致的 DashScope 或 `*.maas.aliyuncs.com` 地址，空地址默认北京；其他区域 Key 因地址错配可能返回 401。Live Voice 开启时，新端点需完成 Realtime handshake 后才保存。
