Skip to content
FunCoding

Search

Search docs, Skills and MCP

Omni 媒体工具与模型访问

选择转换、裁剪、抽帧和模型理解工具,限制参数与额外调用。

This page has not been translated into English yet. The original Chinese version is shown below.

这些策略工具属于 omni 实验分支。默认仅固定策略可调用,对模型隐藏;需要模型主动补证据时,再逐工具开启 modelAccess。

图像与视频

工具参数与用途
omni_downsample_imageJPEG 降采样;maxDimension 默认 1568、quality 75;tokenBudget 支持 256/1024/2048 档位并按 28px patch 网格处理
omni_convert_image转 JPEG/PNG/WebP;format 默认 jpeg,quality 90
omni_clip_image按必填 x、y、width、height 裁剪 PNG;与模型直接使用的 zoom_image 区分
omni_caption_image调用视觉模型输出 caption,可配置 prompt
omni_ocr_image提取可见文字,language 默认自动,文本角色 ocr
omni_downscale_video输出 MP4;maxHeight 480、fps 10、crf 28
omni_clip_video截时间片段;startSec 默认 0、durationSec 默认到结尾、crf 23
omni_extract_keyframes多 JPEG;maxFrames 8、sceneThreshold 0.2、maxDimension 768;支持 scene/uniform、时间范围与 frameTokenBudget
omni_understand_video_segments分段重编码后并行理解,输出带时间范围的 summary;segmentSeconds 默认 30、范围 5–60,maxParallelSegments 8,maxSegmentBytes 10MiB

关键帧默认覆盖全片分桶,uniform 按时长调整采样率;少量帧只用于建立整体线索,不能证明帧间没有发生重要事件。caption、OCR 和分段理解包含模型调用,与本地转码成本不同。

音频

工具参数与用途
omni_extract_audio从视频抽音轨,format 默认 wav,sampleRateHz 16000,channels 1;也支持 MP3/M4A
omni_downsample_audio输出 M4A,bitrateKbps 默认 64,sampleRateHz 16000,channels 1
omni_clip_audio用 startMs、durationMs 截取,durationMs 最少 1000、默认到结尾;format 默认 m4a
omni_transcribe_audio文本转写;chunkSeconds 180、maxInputBytes 10MiB;长音频分段并发 3,共享时间预算
omni_caption_audio语义、音色、事件等描述,不是逐字转写;chunkSeconds 默认 180

转写按时间段拼接,单段失败会在文本中标记,不一定让整个结果失败;也会检测并截断重复退化。使用结果前检查缺失段和识别误差,不能只看调用成功状态。

工具设置与墙钟超时

工具级默认参数放在 omni.processing.policyTools 下:

{
  "omni": {
    "enabled": true,
    "processing": {
      "policyTools": {
        "omni_transcribe_audio": {
          "settings": {"maxInputBytes": 33554432, "chunkSeconds": 300},
          "runtime": {"timeoutMs": 1800000},
          "modelAccess": {
            "enabled": true,
            "defaultArguments": {"chunkSeconds": 180},
            "lockedArguments": {}
          }
        }
      }
    }
  }
}

这是扩大转写文件上限、延长超时并开放模型调用的示例,不是默认配置。runtime.timeoutMs 必须小于一小时 staging 清扫宽限窗,否则启动失败;长任务不能靠无限增大超时绕过清理边界。

模型可见参数

defaultArguments 为每次调用注入默认值,模型可覆盖;lockedArguments 从可见 schema 中移除并由运行环境注入,模型执意传入会被拒绝。同一键不能同时出现在两处。

parameterSchema 可选,只能收窄原 schema,不能添加原工具没有的属性。baseUrl、apiKeyEnv 等运维字段不会暴露给模型;相关工具的独立模型配置仍可能带来额外模型请求。

结果读取

成功调用会列出每个产物的绝对路径,模型可通过 read_file 读取结果。关键帧逐张作为独立产物入库;transcript、caption、ocr、summary 使用文本通道并保留对应 role,供后续策略与媒体记忆查询。

开放工具会在媒体理解指引中列出可用补证据方式;没有开放任何工具时,模型应明确证据不足,而不是声称已查看原始完整媒体。