AI 月报 · 2026年5月 · 5月1日 – 5月31日
模型开源与智能体生态加速
15 条
模型效率与性价比竞赛
本月多款新模型强调以更低成本实现接近前沿的性能。Ling-2.6-1T 采用 MoE 架构,激活参数 630 亿,专注令牌效率;ERNIE 5.1 Preview 以约 1/3 参数和 6% 预训练成本实现领先性能;Grok-4.3 降价同时 ELO 提升 321 点;DeepSeek V4 性能接近前沿但价格仅一小部分。这些发布表明行业竞争从单纯追求规模转向优化效率与成本。
AntLingAGI 开源 Ling-2.6-1T 模型,登陆 Hugging Face 平台
AntLingAGI 团队宣布 Ling-2.6-1T 模型正式开源,已登陆 Hugging Face 平台,并通过 Novita Labs 提供官方推理体验。该模型采用混合专家架构,总参数 1 万亿、激活参数 630 亿,核心优化方向为“令牌效率”以满足真实生产需求。具体表现为:低令牌开销,能在无需冗长推理链的情况下保持强大智能;可靠的多步执行能力,提升指令、工具、上下文和工作流的控制水平;生产就绪的部署特性,覆盖从代码生成到错误修复的任务,并广泛兼容各类智能体框架。团队旨在通过降低测试、部署、定制和构建的难度,为开发者创造价值。
X:蚂蚁百灵 (@AntLingAGI)
ERNIE 5.1 Preview 发布,架构更轻性能更强
百度 ERNIE 5.1 Preview 模型正式上线。该模型采用更轻量高效的架构,在总参数量压缩至前代约 1/3、激活参数量约 1/2 的同时,仅消耗可比模型约 6% 的预训练成本,实现了在其规模下的领先基础性能。根据@arena 的 Text Arena 榜单,ERNIE 5.1 Preview 在全球总排名第 13 位,并位列中国实验室第一。其在多个细分领域进入全球前十,特别是在法律与政府领域排名第一。百度预告将在 2026 年的 Baidu Create 大会上发布更多 ERNIE 模型更新。
X:百度 Baidu (@Baidu_Inc)
Grok-4.3 上线 OpenRouter 性价比提升显著
@xai 的新模型 Grok-4.3 现已在 OpenRouter 上线! Grok-4.3 以比 Grok-4.2 更低的价格发布,同时在代理性能上实现大幅跃升:在 @ArtificialAnlys 的 GDPval-AA 基准上 ELO 分数提升 321 点至 1500,尽管价格更低,但仍超越了其他顶级模型。
X:OpenRouter (@OpenRouter)
哈佛新研究:AI 模型“急诊科”场景诊断能力有望超越人类医生
哈佛医学院与贝斯以色列女执事医疗中心的研究显示,OpenAI 的一款推理模型在真实临床病例测试中,其诊断与制定治疗方案的能力达到甚至超越了人类医生水平。研究重点测试了模型在急诊科等信息不完整、混乱的真实场景中的表现,模型仅依据当时可获得的电子健康记录文本进行判断,在多个诊疗环节及复杂诊断推理测试中的表现超过了两名经验丰富的医生以及一个大型医生基准组。但模型目前完全依赖文本病历,未处理影像等关键信息。研究者强调,AI 并非取代医生,而是有望成为临床决策支持工具,尤其适用于急诊等高压环境。下一步需在真实临床环境中测试其对患者结局的实际改善效果。
IT 之家·人工智能
智能体自主化与生态扩展
Agents 现可创建 Cloudflare 账户、购买域名并部署
Cloudflare 宣布 AI 代理现可作为独立客户直接使用其服务。代理能够自主创建 Cloudflare 账户、开通付费订阅、注册域名,并立即获取 API 令牌以部署代码。人类用户可保留授权监督权限,但无需手动操作控制台、复制粘贴 API 令牌或输入信用卡信息。这一更新使代理能够以自动化流程完成从账户开设到服务部署的全链路操作。
Cloudflare Blog
Codex 简化日常办公流程
使用 Codex 处理日常工作从未如此简单。 选择你的角色,连接你每天使用的应用,并尝试建议提示。 Codex 能在研究规划、文档、幻灯片、电子表格等方方面面提供帮助。
X:OpenAI (@OpenAI)
安装孵化宠物技能创造专属宠物
要创建你自己的宠物,请安装 hatch-pet 技能:
X:OpenAI Developers (@OpenAIDevs)
AI 安全与风险警示
微软研究揭示 AI 助手在长文档编辑中普遍损坏内容
微软最新论文指出,当前 AI 助手在执行长链条编辑任务时,普遍会损坏文档内容。研究通过可逆任务对测试了 19 个模型,发现即使是前沿模型平均也会破坏约 25% 的文档内容,且问题随文件增大、流程变长而加剧。失败模式通常不是微小失误,而是偶尔出现的重大错误,这些错误会静默破坏部分文档并随时间累积。研究表明,当前的 LLM 在简短演示或狭窄编码任务中可能表现良好,但作为现实世界长文档工作的委托代理仍不可靠。
X:Rohan Paul (@rohanpaul_ai)
微软研究揭示 AI 智能体交互网络风险
安全的智能体并不能保证由相互连接的智能体组成的生态系统是安全的。微软研究院研究了当 AI 智能体交互时会出现什么问题,以及为什么网络层面的风险需要新的方法。了解更多:https://www.microsoft.com/en-us/research/blog/red-teaming-a-network-of-agents-understanding-what-breaks-when-ai-agents-interact-at-scale/
X:Microsoft Research (@MSFTResearch)
AI 在垂直领域的突破性应用
AI 在医疗、教育、农业等领域的应用取得显著进展。哈佛研究显示 AI 在急诊科诊断能力超越人类医生;Mayo Clinic 的 AI 可提前三年检测胰腺癌;AI 导师使学生学习效果翻倍;AI 预测害虫爆发准确率达 88%。这些案例表明 AI 正从通用能力向解决实际问题的专业工具演进。
哈佛新研究:AI 模型“急诊科”场景诊断能力有望超越人类医生
哈佛医学院与贝斯以色列女执事医疗中心的研究显示,OpenAI 的一款推理模型在真实临床病例测试中,其诊断与制定治疗方案的能力达到甚至超越了人类医生水平。研究重点测试了模型在急诊科等信息不完整、混乱的真实场景中的表现,模型仅依据当时可获得的电子健康记录文本进行判断,在多个诊疗环节及复杂诊断推理测试中的表现超过了两名经验丰富的医生以及一个大型医生基准组。但模型目前完全依赖文本病历,未处理影像等关键信息。研究者强调,AI 并非取代医生,而是有望成为临床决策支持工具,尤其适用于急诊等高压环境。下一步需在真实临床环境中测试其对患者结局的实际改善效果。
IT 之家·人工智能
本周的积极信号:AI 在医疗、教育、农业与科研领域的突破性进展
近期多项进展展现了 AI 的巨大积极影响。医疗领域,Mayo Clinic 的 AI 能通过常规 CT 提前最多三年检测胰腺癌,强生利用 AI 将新药线索生成时间减半。教育方面,哈佛研究显示 AI 导师使学生学习效果翻倍,泰国培训 16 万名教师惠及 330 万学生。农业上,AI 能以约 88% 准确率预测害虫爆发。科研中,AI 快速筛查 NASA 数据,新发现超一万颗系外行星候选。此外,香港推出 AI 洪水预报系统,Atlassian 和 Twilio 等公司也因 AI 驱动业绩增长并上调预期。这些案例平衡了 AI 风险,凸显其创新潜力。
Tomasz Tunguz 博客(VC 分析)
以 AI 联合临床医生开启医疗保健新模式
研究团队正致力于开发一款 AI 联合临床医生,以探索 AI 增强医疗护理的路径。该研究旨在创建一种新型医疗模式,让 AI 作为临床医生的协同伙伴深度参与诊疗过程,共同提升医疗服务的质量和效率。这项工作标志着医疗保健领域正从辅助工具阶段,迈向 AI 作为核心协作者的新范式。
Google DeepMind:Blog(RSS)
资本投入与市场分化
Alphabet 市值单日暴增 4200 亿美元,逼近英伟达
Alphabet 股价大涨约 9%,市值单日增加约 4200 亿美元,创下历史最大单日涨幅纪录。其市值目前仅比全球市值最高的上市公司 Nvidia 低约 6%。这一强劲表现的核心驱动力来自 Google Cloud,其营收实现了 63% 的增长,增速超过了近期 AWS 和 Azure 的表现。增长主要得益于企业客户广泛采用基于 Gemini 模型和定制 TPU 构建的 AI 解决方案。
X:Rohan Paul (@rohanpaul_ai)
Softbank 计划将估值高达 1000 亿美元的新 AI 与机器人公司 Roze 上市
软银集团计划在美国启动并推动其新成立的人工智能与机器人公司 Roze 进行首次公开募股。据《金融时报》报道,这家新公司的估值可能高达 1000 亿美元。此举标志着软银在 AI 和机器人领域的重大战略布局,旨在将相关业务整合并独立上市以获取市场资源与更高估值。
The Decoder:AI News(RSS)
史上最大的资本错配?
随着全球科技巨头与初创企业持续将海量资金投入生成式人工智能和大语言模型的研发竞赛,业界开始出现对资本配置效率的深刻担忧。巨额投资集中于少数头部模型如 GPT、Claude 和 LLaMA 的迭代,而基础设施、能源消耗及实际商业应用场景的落地速度引发质疑。部分分析师指出,超过千亿美元的资金涌入可能催生技术泡沫,并挤压其他关键科技领域的创新资源。这种集中趋势正促使投资者重新评估风险与回报的平衡。
Gary Marcus:The Road to AI We Can Trust(RSS)
数据来自 AIHOT,标题和摘要由 AI 根据原文生成,细节以原文为准。