跳到正文
FunCoding

搜索

搜索文档、Skill 和 MCP

手动配置本地路由器

准备 LiteRT-LM、下载 Gemma 模型并验证 Gemini API 格式的本地 HTTP 端点。

手动流程用于自动安装受限或需要自定义运行时位置的环境。它仍是实验性功能;一般情况下可先使用自动安装。

准备对应平台运行时

官方手动指南采用 LiteRT-LM 的 v0.9.0-alpha03 发布,并列举以下二进制:

平台指南中的文件
Windows x86_64lit.windows_x86_64.exe
Linux x86_64lit.linux_x86_64
macOS arm64lit.macos_arm64

这份表是该指南提供的手动下载示例,不是 LiteRT-LM 全部平台支持清单。下载链接与新版兼容性以官方指南及其引用的发布页为准。

Linux/macOS 下载后需要执行权限,例如 chmod a+x lit.macos_arm64。Windows GPU 运行还需要 DirectXShaderCompiler,指南要求把对应架构的 dxil.dll 和 dxcompiler.dll 放在可执行文件旁。macOS 如出现系统阻止提示,先核对下载来源,再按系统“隐私与安全性”中的允许操作处理。

下载模型并启动

以 macOS 为例:

./lit.macos_arm64 pull gemma3-1b-gpu-custom
./lit.macos_arm64 serve --port=9379 --verbose

pull 过程会要求接受 Gemma 条款。Linux/Windows 用对应平台的可执行文件运行同样的 pull 与 serve 子命令。官方 macOS pull 示例曾把文件名写为 lit.lit.macos_arm64,本页按下载文件名统一为 lit.macos_arm64。

验证本地 HTTP 请求

curl "http://localhost:9379/v1beta/models/gemma3-1b-gpu-custom:generateContent" \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{"contents":[{"role":"user","parts":[{"text":"Tell me a joke."}]}]}'

这验证 Gemini API 格式的本地端点可以接收请求,不只是端口打开。检查响应与服务日志后再连接 CLI;Windows PowerShell 可按官方指南使用 Invoke-RestMethod 发同样的 JSON 请求。

连接 Gemini CLI

{
  "experimental": {
    "gemmaModelRouter": {
      "enabled": true,
      "classifier": {
        "host": "http://localhost:9379",
        "model": "gemma3-1b-gpu-custom"
      }
    }
  }
}

host 必须与实际启动端口一致。手动指南指定模型名为 gemma3-1b-gpu-custom,不要将另一个本地模型仅凭兼容 HTTP 格式就视为已验证替代。修改后重启 CLI,并检查分类日志。

诊断顺序

  1. 确认二进制可运行,平台与所需动态库匹配。
  2. 确认模型已经下载且服务启动成功。
  3. 用直接 HTTP 请求验证端点、端口和模型名。
  4. 核对 CLI 的 enabled、host、model,重启后查看日志。
  5. 检查是否因服务不可用而回退云端分类,以及是否有更高优先级的主模型选择。

本地分类成功只证明路由器可用,不能据此把整个会话描述为离线。完整选择关系见模型路由。