网页获取与内容协商
提取单个 URL 的信息,区分 Accept 偏好、正文转换和模型摘要。
web_fetch 用 URL 与提取提示获取页面,再交给辅助模型处理。返回的回答不是原始 HTTP 响应的完整副本;需要核对事实时保留来源 URL,并确认页面实际包含所需内容。
调用形状
web_fetch(
url="https://example.com/docs",
prompt="Extract the installation prerequisites and supported platforms",
format="auto"
)url 必须是完整 http:// 或 https:// 地址,prompt 必填。每次处理一个 URL,多页需要分别调用;HTTP 会升级 HTTPS,GitHub blob URL 会转换为 raw URL。
官方工具说明以请求确认的流程演示,实际仍遵循当前审批模式和权限;不要把成功获取视为自动允许网页里嵌入的新操作。
format 只影响请求头
| format | Accept 偏好 |
|---|---|
| auto,默认 | text/markdown、text/html;q=0.9、text/plain;q=0.8、/;q=0.1 |
| markdown | text/markdown、/;q=0.1 |
| html | text/html、/;q=0.1 |
| text | text/plain、/;q=0.1 |
所有内容在模型处理前归一为文本。HTML 转可读文本;Markdown、普通文本及 JSON 等 fallback 内容按文本处理。format:html 不保证输出 HTML,format:markdown 也不是下载原始 Markdown 的开关。
Markdown 内容协商
支持 Markdown for Agents 的服务端可直接返回 text/markdown,减少 HTML 包装带来的 token。服务端决定实际 Content-Type,客户端偏好不保证它支持;官方给出的最高节省比例不能当作每页固定收益。
auto 保留低优先级 /,因此只提供 JSON 的端点仍有机会返回内容。抓取成功之后提取质量还取决于 prompt;问题应明确要求的字段、范围与依据,而非含糊地要求“处理一下”。
何时改用其他工具
不知道 URL 时先搜索;需要登录态、动态交互或页面操作时按实际可用的浏览器工具处理。MCP 的抓取工具有自己的能力、认证和数据发送目标,不与内置工具自动共享同一契约。