AI Monthly · July 2026 · Jul 1 – Jul 31
智能体落地与算力竞逐
24 items
模型迭代与开源生态
本期多家机构发布新模型,性能提升且价格下降,开源模型成为重要力量。Anthropic 发布 Claude Sonnet 5,性能接近 Opus 4.8 但定价更低;Google 推出 Nano Banana 2 Lite 和 Gemini Omni Flash,主打速度与成本;美团开源 LongCat-2.0,采用 1.6T 参数 MoE 架构,在国产算力集群上训练;NVIDIA 发布扩散语言模型,提升生成吞吐量。这些发布显示模型能力持续增强,同时价格竞争加剧,开源模型在编程等场景中逐步获得采用。
Claude Sonnet 5 发布
Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可自主运行。性能接近 Opus 4.8,定价更低:即日起至 2026 年 8 月 31 日,输入 token $2/百万,输出 $10/百万,之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6,在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。即日起在所有套餐及 Claude Code、Claude API 中可用。
Anthropic:Newsroom(网页)
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash
Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-flash-preview),支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,面向开发者开放 API。
Google DeepMind:Blog(RSS)
美团 LongCat 发布旗舰模型 LongCat-2.0
美团 LongCat 推出旗舰模型 LongCat-2.0,采用 1.6T 参数 MoE 架构(约 48B 活跃参数),原生支持 1M 上下文窗口。定价为 Input Cache $0.015/1M tokens、Input $0.75/1M tokens、Output $2.95/1M tokens。模型专为 Agentic Coding 设计,包含三大技术:LSA 稀疏注意力实现高效 1M 扩展;Zero-Compute Experts 动态激活 33B–56B 参数/token,无算力浪费;MOPD 将专家分为 Agent / Reasoning / Interaction 三组,按任务门控路由。在 SWE-bench Pro 上取得 59.5 分,性能接近主流闭源模型。现已上线 SiliconFlow Day 0 服务。
X:硅基流动 SiliconFlow (@SiliconFlowAI)
美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型
美团于 6 月 30 日发布新一代万亿参数大模型 LongCat-2.0 并开源。总参数 1.6T,平均激活约 48B,原生支持 1M 超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用 LSA 稀疏注意力、零计算专家、ScMoE 及 MOPD 多专家融合(Agent/Reasoning/Interaction 三组专家)架构。评测中 SWE-bench Pro 获 59.5,SWE-bench Multilingual 获 77.3。预览版已通过 OpenRouter 和 longcat.ai 开放,月调用量跻身 OpenRouter 全球前三。
公众号:龙猫 LongCat(美团)
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型
NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。
MarkTechPost(RSS)
智能体应用加速落地
Acti 将 AI 智能体直接放入手机键盘
新加坡初创公司 Acti 发布基于 Google Gemini 的智能体键盘,可代替用户在应用中执行操作。核心功能 Skills 允许用自然语言创建快捷方式,如长按 T 键翻译消息、C 键发送会议链接。早期测试者两周内创建超 1000 个 Skills。采用本地优先架构,默认不访问私人消息。公司获 530 万美元种子轮融资,由 BITKRAFT Ventures 领投,现已开放下载。
TechCrunch:AI(RSS)
xAI 发布 Voice Agent Builder 测试版
xAI 推出 Voice Agent Builder 测试版,这是一个基于 Grok Voice 的无代码平台,可在两分钟内创建生产级语音智能体。它集成电话、知识检索、工具、MCP、Guardrails 及可观测性,支持连接现有 SIP 号码、API 和 WebSocket,采用语音到语音路径。在 τ-voice Bench 上,Grok Voice Think Fast 1.0 得分 67.3%,领先 Gemini 3.1 Flash Live(43.8%)和 GPT Realtime 1.5(35.3%)。定价为每分钟音频 0.05 美元、电话费 0.01 美元,提供 80+ 种语音及声音克隆,每个账户附赠一个免费电话号码。
xAI:News(网页)
昆仑万维天工 3.2 发布 Skywork Tags,AI 智能体加入工作群聊
昆仑万维天工 3.2 发布 Skywork Tags,将 AI 智能体以团队成员身份接入 Slack、飞书、钉钉、Discord、Telegram 等即时通讯工具。团队可在原有工作群中@Skywork 参与讨论,无需切换窗口或迁移数据。共享版 Agent 持续吸收多样上下文后表现反超精心调教的个人版,团队最终完全改用共享版。Skywork Tags 不要求改变工作方式,让 AI 积累团队上下文并越用越强。
公众号:昆仑万维(天工)
AI 版支付宝开放公测,蚂蚁阿宝无需邀请码即可体验
支付宝阿宝 AI 助手今日正式开放公测,iOS 和安卓用户可在应用商店或支付宝 App 搜索“阿宝”或“蚂蚁阿宝”直接体验。开通后右滑进入新版,以对话方式安排办事,例如说出“查公积金”,阿宝会自动匹配对应小程序和服务入口,用户点击确认即可完成。支付宝承诺所有资金变动与支付环节均需用户本人确认,扫码、转账等功能已预留入口。
IT 之家·人工智能
基础设施与算力投资
算力成为 AI 发展的核心资源,科技巨头和投资机构加大投入。黑石计划在日本投资 300 亿美元建设 AI 数据中心,并与阿波罗、博通成立 AI XPV 平台;Meta 计划推出云业务出售算力;AWS 投入 10 亿美元派驻工程师协助客户落地 AI;Cloudflare 推出 AI 流量管理和 Monetization Gateway,为网站提供变现方案。这些动态显示,算力基础设施的建设和商业化正在加速。
黑石未来 3~5 年拟投 300 亿美元在日本建 AI 数据中心,联合成立 AI XPV 平台
黑石计划未来 3~5 年在日本 AI 数据中心领域投资 300 亿美元,此前的 500MW 基础上新增超 1GW 容量。黑石总裁认为 AI 投资仍处早期,真正风险是算力短缺而非基建泡沫;谷歌、亚马逊是英伟达潜在挑战者。此外,黑石、阿波罗、博通本月 9 日成立 AI XPV 平台,目标 2028 年向 OpenAI、Anthropic 等提供超 20GW 算力,首期 350 亿美元支持 Anthropic 在 Fluidstack 数据中心部署 1GW 基础设施。
IT 之家·人工智能
Meta 效仿 SpaceX,将过剩 AI 算力变现
据 Bloomberg 报道,Meta 正计划推出云基础设施业务 Meta Compute,对外出售 AI 计算能力和模型访问权限,直接与 AWS、Google Cloud 及 Azure 竞争。Meta 已承诺未来几年投入 1829 亿美元建设 AI 基础设施,其中俄亥俄州数据中心(规模如曼哈顿)将于今年上线。新业务由基础设施主管 Santosh Janardhan、Meta 超级智能实验室负责人 Daniel Gross 和总裁 Dina Powell McCormick 领导。Meta 可能效仿 CoreWeave 出售裸计算能力,并像 AWS 一样托管 AI 模型(包括近期发布的闭源模型 Muse Spark)。扎克伯格此前已表示云业务“definitely on the table”。
TechCrunch:AI(RSS)
亚马逊 AWS 砸 10 亿美元,派遣工程师进驻客户公司
亚马逊 AWS 宣布设立新部门,组建前置驻场工程师团队,先期投入 10 亿美元(约 67.97 亿元人民币)。团队分批派驻客户企业,每批 5-6 组工程师,驻场周期 45 天,协助客户落地人工智能软件与智能体应用。该模式在 Palantir、Salesforce、Anthropic、谷歌云等企业已有先例,领英数据显示 2023 至 2025 年间同类岗位需求增长 42 倍。新部门员工规模将达数千人,首批客户包括 NBA 与理光。
IT 之家·人工智能
Cloudflare 推出全新 AI 流量管理选项:区分搜索、智能体与训练爬虫,保护广告页面
Cloudflare 为所有网站所有者提供更精细的 AI 流量管控选项,取代一刀切的屏蔽方式。用户可轻松区分并管理搜索爬虫、AI 智能体爬虫和训练爬虫,同时新增保护广告变现页面的能力。
Cloudflare Blog
Cloudflare 推出 Monetization Gateway:通过 x402 协议为任何资源收费
Cloudflare 开放 Monetization Gateway 候补名单,允许对 Cloudflare 背后的任何网页、数据集、API 或 MCP 工具收费。费用通过 x402 开放协议以稳定币结算,用户无需自建支付栈。
Cloudflare Blog
AI 治理与信任争议
随着 AI 应用深入,治理和信任问题凸显。Anthropic 在 Claude Code 中植入隐写术识别中国用户,引发信任危机;Meta 秘密测试竞品安全,被指违反服务条款;商务部解除对 Claude Fable 5 的出口管制,显示政策调整。这些事件表明,AI 发展需要在创新与合规之间寻求平衡。
Anthropic 在 Claude Code 中植入隐写术代码识别中国用户
Anthropic 在 Claude Code 中植入隐写术:读取本地时区(Asia/Shanghai 或 Asia/Urumqi)和 ANTHROPIC_BASE_URL 环境变量,与一份经 base64+XOR(密钥 91)加密的 147 个域名列表(含美团、字节跳动、月之暗面等)比对,识别中国用户。识别后,在请求发送前将系统提示词中日期字符串的单引号(U+0027)替换为其他 Unicode 字符,连字符改为斜杠,作为 2-3 比特分类标记传回服务器。该隐蔽行为被社区逆向发现后引发争议,被认为破坏用户信任。
公众号:数字生命卡兹克
Meta 秘密测试 ChatGPT 等竞品:承包商假扮未成年发送数万条危机提示
Meta 通过承包商 Covelen 发起代号“Cannes”的项目,雇佣数百人假扮未成年人,向 ChatGPT、Gemini 和 Character.AI 发送关于自杀、自残、饮食障碍和毒品的敏感提示,并将回复录入表格。2025 年 8 月一轮测试中发送了超过 4.5 万条提示。Meta 称这是行业标准安全测试,未将数据用于训练自家模型。被测试公司不知情——Character.AI 表示违反其服务条款,OpenAI 已调查,Google 称未批准。青少年使用 AI 聊天机器人引发的担忧持续,此前已有用户自杀事件。
The Decoder:AI News(RSS)
商务部解除 Claude Fable 5 等出口管制
我们已收到通知,商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。 我们明天将开始恢复访问,并很快分享最新进展。 我们感谢用户的耐心,也感谢所有与我们合作重新部署模型的各位。
X:Anthropic (@AnthropicAI)
开发者工具与工作流
开发者工具持续演进,提升 AI 应用开发效率。Google 发布 ADK Go 2.0 和 Genkit Agents API,简化多智能体应用构建;Claude Code 更新增加后台智能体通知和/dataviz 技能;阿里巴巴发布 Page Agent,实现网页 DOM 自然语言操控;Cloudflare 推出 AI 流量管理。这些工具降低了开发门槛,推动了智能体应用的普及。
ADK Go 2.0 发布:构建可靠的多智能体应用,新增基于图的工作流引擎、人工参与循环与动态编排
Agent Development Kit (ADK) for Go 2.0 发布,引入了一类基于图的工作流引擎,用于组合复杂多智能体应用。新版本内置人工参与循环(HITL)编排、使用纯 Go 代码的动态执行、以及指数退避重试等自动弹性特性。统一执行模型后,单智能体应用与复杂图均运行在同一运行时上,简化了遥测与状态持久化。
Google Developers Blog(RSS)
用 Genkit 构建智能体全栈应用
开源框架 Genkit 推出 Agents API,将消息历史、工具循环和流式传输封装为单一接口,简化对话 AI 开发。该 API 支持服务器或客户端管理的状态持久化,可实现历史分支、长时间运行的分离任务及多智能体协调等高级工作流,并通过统一线协议连接前后端。目前以 TypeScript 和 Go 预览版发布,集成 Genkit Developer UI,开发者无需编写客户端代码即可测试、调试和检查智能体快照。
Google Developers Blog(RSS)
Claude Code v2.1.198 发布
Claude Code v2.1.198 更新。Claude in Chrome 现已全面可用。为 claude agents 新增后台智能体通知(agent_needs_input / agent_completed)。新增 /dataviz 技能,提供图表与仪表盘设计指导及配色验证器。Gateway 增加 AWS 上的 Claude Platform 作为上游提供商。后台智能体在 worktree 中完成代码后自动提交、推送并创建草稿 PR。内置 Explore 智能体现继承主会话模型(上限 opus)。修复网络短暂断开导致响应中断、后台任务卡在“Running”状态、智能体团队队友因 API 错误失败等问题。
Claude Code:GitHub Releases(RSS)
阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控
阿里巴巴发布 Page Agent,一个开源的 JavaScript 客户端库,嵌入网页后可通过自然语言指令直接操作 DOM 元素。与 Playwright、Puppeteer 等外部浏览器自动化工具不同,Page Agent 不依赖截图或多模态模型,而是将实时 DOM 脱水压缩为 FlatDomTree 文本映射,让纯文本模型精准执行点击、表单填写等操作。它继承用户 cookies 和会话,无需独立后端,并支持任意 OpenAI 兼容端点的模型(示例使用 `qwen3.5-plus`)。项目采用 MIT 许可证,适合在自有应用内构建 AI 副驾、智能表单填充或无障碍控制等场景,但限于单页面范围,风险操作仍需服务端验证。
MarkTechPost(RSS)
AI 对就业与技能的影响
AI 对就业市场的影响成为关注焦点。数据显示 AI 相关裁员接近 9 万个,但高 AI 投入企业员工增长 10.2%;英国职场 AI 采用率翻倍,但仅 15% 的深度用户获得晋升加薪优势;具身智能数据采集员岗位出现,日薪 200 元起。这些现象表明,AI 正在重塑就业结构,技能差距可能加剧不平等。
AI 就业争论变得更加混乱
截至 2026 年 5 月,AI 相关裁员接近 9 万个,预计未来五年美国最多 15% 的岗位将被 AI 替代。但 Ramp 与 Revelio Labs 对近 22,000 家公司的报告发现,高 AI 投入企业(前三个月人均月均支出 30 美元)总员工数增长 10.2%,入门级岗位增长 12%。报告认为 AI 并非普遍导致岗位消失,而是在资源充裕的科技企业里成为扩张工具——降低工程、销售、客服等职能的生产成本,从而推动整体增员。但仅购买订阅而未持续投入的公司未见人头增长,可能加剧企业间的资源鸿沟。
TechCrunch:AI(RSS)
英国职场 AI 采用率翻倍,仅 15%“AI 先锋”获得晋升加薪优势
Google UK 与 Public First 研究发现,英国职场 AI 采用率一年内从 34% 升至 73%,但呈不均衡曲线。仅 15% 的“AI Trailblazers”(深度用户)晋升概率高 84%、绩效高 88%、加薪概率高 55%,每周节省近 8 小时。其余 85% 仍处于旁观、实验或实践阶段。阻碍因素包括:一次即弃的提示词习惯、搜索框思维、缺乏明确使用许可。Public First 推出 AI 技能测验,Google 的“AI Works for Britain”计划支持 2030 年前培训 1000 万工人 AI 技能的目标。
Google Blog:AI(RSS)
具身智能数据采集员:日薪 200 元起,给机器人当老师
具身智能数据采集员以日薪 200-250 元招兼职,无需学历经验。面试先测量身高体重以适配采集手套,并询问是否晕 VR。工作分两种:遥操作采集——穿戴设备控制双臂机器人完成分拣积木、叠纸杯等动作;无机器人示教采集——徒手重复动作(如叠衣服),设备记录轨迹。全球高质量物理交互数据截至 2026 年初仅约 50 万小时,不足大语言模型训练数据的两万分之一,需大量人力从零采集。
公众号:数字生命卡兹克
Data from AIHOT. Summaries are AI-generated; check the original for details.