Skip to content
FunCoding

Search

Search docs, Skills and MCP

Omni 实验媒体策略

了解实验分支的媒体预处理、推理与上传解耦,以及最小策略配置。

This page has not been translated into English yet. The original Chinese version is shown below.

官方将本功能明确标为仅在 omni 实验分支可用,配置不承诺向后兼容。以下是该实验文档的机制说明,不能据此假定已安装的稳定版支持相同字段。

媒体策略在图片、音频、视频送入模型前执行:识别资源、匹配策略、生成暂存产物、按内容入库,最后附上降质说明投递。它用于控制体积、时长与上下文成本,不会让稀疏关键帧等同于看过完整视频。

最小图片策略

{
  "omni": {
    "enabled": true,
    "processing": {
      "fixedPolicies": {
        "large-image": {
          "mediaTypes": ["image"],
          "when": [">", ["field", "resource.width"], 3000],
          "toolName": "omni_downsample_image",
          "arguments": {"maxDimension": 1568, "quality": 75}
        }
      }
    }
  }
}

将其合并到项目或用户 settings.json。匹配宽度超过 3000px 的图像时,生成最大边 1568px、quality 75 的产物;这些数值是示例策略的选择,不能理解为全部媒体自动采用的阈值。

fixedPolicies 默认空,不运行可选预处理;最终媒体超出传输限制时仍有强制传输守卫。无效策略、未知键或不相容组合会在启动时报 OmniPolicyConfigError,不会悄悄忽略。

推理与上传分开配置

实验功能仍使用 DashScope 临时上传通道;推理可以使用 DashScope 兼容模式,也可以接独立部署的 OpenAI 兼容 Omni 模型。

{
  "omni": {
    "enabled": true,
    "delivery": {
      "upload": {
        "baseUrl": "https://dashscope.aliyuncs.com/compatible-mode/v1",
        "apiKeyEnv": "DASHSCOPE_API_KEY",
        "model": "qwen3.5-omni-plus"
      }
    }
  }
}

这三个字段要同时设置,apiKeyEnv 保存环境变量名,实际变量需在启动前有值。该模型名和端点来自实验文档示例,实际可用性以提供商当前支持为准。

上传 endpoint、key、model 用于 getPolicy、文件上传与上传缓存;推理仍用模型配置里的 endpoint 和 key,两套凭据不交叉发送。三项都不设时,沿用当前推理配置上传,因此要求它本身是带静态 API key 的 DashScope 兼容配置。

先判断证据范围

每个有损结果附带媒体降质说明,文本替代附媒体转写说明,无法投递则以媒体省略占位。模型会收到渐进理解指引:只对已有证据下结论,必要时用开放的裁剪、转写或抽帧工具补证据。

官方电影案例展示了全文转写、稀疏帧和开头片段的组合,不构成任意影片都能零遗漏分析的保证。ASR 可能误识别,静态帧之间的动态信息需要再取片段验证;缓存命中也不能保证后续模型请求免费。

详细配置见策略条件与派生链、媒体工具和传输与预算。