跳到正文
FunCoding

搜索

搜索文档、文章、Skill 和 MCP

Vydra

在 OpenClaw 中使用 Vydra 图像、视频和语音功能

内置的 Vydra 插件提供:

  • 通过 vydra/grok-imagine 生成图像
  • 通过 vydra/veo3(文本生成视频)和 vydra/kling(图像生成视频)生成视频
  • 通过 Vydra 基于 ElevenLabs 的 TTS 路由合成语音

OpenClaw 对这三种能力使用同一个 VYDRA_API_KEY。

属性值
提供商 IDvydra
插件内置,enabledByDefault: true
身份验证环境变量VYDRA_API_KEY
新手引导标志--auth-choice vydra-api-key
直接 CLI 标志--vydra-api-key <key>
契约imageGenerationProviders、videoGenerationProviders、speechProviders
基础 URLhttps://www.vydra.ai/api/v1(使用 www 主机)

使用 https://www.vydra.ai/api/v1 作为基础 URL。Vydra 的根域名主机(https://vydra.ai/api/v1)目前会重定向到 www。某些 HTTP 客户端会在此跨主机重定向中丢弃 Authorization,导致有效的 API 密钥被误报为身份验证失败。内置插件会将任何已配置的 vydra.ai 基础 URL 规范化为 www.vydra.ai,以避免此问题。

设置

运行交互式新手引导

openclaw onboard --auth-choice vydra-api-key

或者直接设置环境变量:

export VYDRA_API_KEY="vydra_live_..."

选择默认能力

从以下能力(图像、视频或语音)中选择一种或多种,并应用对应的配置。

能力

图像生成

默认且唯一的内置图像模型:

  • vydra/grok-imagine

将其设置为默认图像提供商:

{
  agents: {
    defaults: {
      imageGenerationModel: {
        primary: "vydra/grok-imagine",
      },
    },
  },
}

内置支持仅限文本生成图像,每个请求最多生成一张图像。Vydra 托管的编辑路由要求使用远程图像 URL,而内置插件未添加 Vydra 专用的上传桥接。

有关共享工具参数、提供商选择和故障转移行为,请参阅图像生成。

视频生成

已注册的视频模型:

  • vydra/veo3 用于文本生成视频(拒绝图像引用输入)
  • vydra/kling 用于图像生成视频(要求恰好提供一个远程图像 URL)

将 Vydra 设置为默认视频提供商:

{
  agents: {
    defaults: {
      videoGenerationModel: {
        primary: "vydra/veo3",
      },
    },
  },
}

注意:

  • vydra/kling 会预先拒绝本地文件上传;仅支持远程图像 URL 引用。
  • Vydra 的 kling HTTP 路由对于究竟要求 image_url 还是 video_url 一直表现不一致;内置提供商会在两个字段中发送同一个远程图像 URL。
  • 内置插件采取保守策略,不会转发未记录的样式选项,例如宽高比、分辨率、水印或生成的音频。

有关共享工具参数、提供商选择和故障转移行为,请参阅视频生成。

视频实时测试

提供商专用的实时测试覆盖:

OPENCLAW_LIVE_TEST=1 \
OPENCLAW_LIVE_VYDRA_VIDEO=1 \
pnpm test:live -- extensions/vydra/vydra.live.test.ts

内置的 Vydra 实时测试文件涵盖:

  • vydra/veo3 文本生成视频
  • vydra/kling 使用远程图像 URL 生成图像转视频

必要时可覆盖远程图像测试夹具:

export OPENCLAW_LIVE_VYDRA_KLING_IMAGE_URL="https://example.com/reference.png"
语音合成

将 Vydra 设置为语音提供商:

{
  tts: {
    provider: "vydra",
    providers: {
      vydra: {
        apiKey: "${VYDRA_API_KEY}",
        voiceId: "21m00Tcm4TlvDq8ikWAM",
      },
    },
  },
}

默认值:

  • 模型:elevenlabs/tts
  • 语音 ID:21m00Tcm4TlvDq8ikWAM(“Rachel”)

内置插件提供这一种已知可正常使用的默认语音,并返回 MP3 音频文件。

相关内容