Google Research 汇总 I/O 2026 研究成果:推出 Gemini for Science 与 Antigravity 2.0
Google Research 在 I/O 2026 上汇总公布多项研究突破与工具更新,推出科研智能体套件 Gemini for Science 以及升级版智能体开发平台 Google Antigravity 2.0。
推荐理由:官方系统梳理了科研智能体与端侧硬件的最新落地进展,读者可据此了解前沿研究向工程化产品转化的具体路径。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google Research 在 I/O 2026 上汇总公布多项研究突破与工具更新,推出科研智能体套件 Gemini for Science 以及升级版智能体开发平台 Google Antigravity 2.0。
推荐理由:官方系统梳理了科研智能体与端侧硬件的最新落地进展,读者可据此了解前沿研究向工程化产品转化的具体路径。
智谱联合 TileRT 团队推出 GLM-5.1 高速版 API(GLM-5.1-highspeed),输出速度达 400 tokens/s,在完整保留旗舰模型能力的同时实现低延迟。
推荐理由:智谱通过底层推理引擎重构将旗舰模型输出速度提升至400 tokens/s,为高频交互与长程编码场景提供了极低延迟的落地路径。
Google 宣布其实验研究辅助系统 ERA(Empirical Research Assistance)论文在 Nature 正式发表,并开始通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。
推荐理由:原文展示了结合树搜索与大模型自动编写并优化科研代码的方法,为多学科计算实验的自动化提供了实测参考。
Google DeepMind 宣布在实验性原型 Project Genie 中接入 Google 街景图像能力,允许用户基于真实地理位置生成可交互的虚拟世界。
推荐理由:结合街景图像生成可交互世界,为 AI 智能体与机器人导航提供了锚定真实地理数据的虚拟仿真环境。
Google DeepMind 推出 Gemini for Science 系列科学工具与实验原型,旨在通过通用 AI Agent 加速科学研究全流程。Google Labs 上线了三项核心原型:基于 Co-Scientist 的多智能体假说生成、基于 AlphaEvolve 与 ERA 的代码并行计算发现,以及基于 NotebookLM 的文献深度洞察。
推荐理由:原文系统介绍了结合多智能体与专业数据库的科研工具集,读者可以据此了解通用 AI 在假说生成与文献分析中的具体落地形态。
Google DeepMind 正式推出 Gemini 3.5 系列并首发上线 Gemini 3.5 Flash,重点强化复杂长程智能体与编程工作流能力。该模型在 Terminal-Bench 2.1(76.2%)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度达到其他前沿模型的 4 倍。
推荐理由:原文给出了模型在智能体与编程基准上的性能表现及吞吐速度对比,读者可以据此评估其作为生产环境主力模型的调用效率与成本。
Google DeepMind 联合 Google 多团队推出基于 Gemini 的多智能体科研系统 Co-Scientist,并于 Nature 发表相关研究。
推荐理由:多智能体通过辩论与淘汰机制生成科学假说,为大模型在复杂生命科学与跨学科研究中的落地提供了完整范式。
Google DeepMind 复盘了由 Gemini 驱动的算法设计编码智能体 AlphaEvolve 推出一年以来的应用进展,该系统已转为 Google 核心基础设施组件。
推荐理由:原文详细梳理了编码智能体从基础算法拓展到芯片设计与商业优化的具体数据,读者可以据此评估 AI 辅助算法探索在各行业落地的实际深度。
Google DeepMind 宣布推出 AI co-clinician 医疗 AI 研究倡议,探索在医生监督下让多模态 AI 智能体协同参与患者诊疗的“三方医疗”模式。
推荐理由:研究展示了结合实时音视频的多模态医疗智能体架构,为评估 AI 辅助问诊与临床安全边界提供了详细测试数据。
DeepSeek 正式上线并开源全新系列模型 DeepSeek-V4 预览版,全系标配 1M 上下文,提供 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本。
推荐理由:原文给出了两个版本的性能定位、架构优化细节与接口迁移时间表,读者可以据此评估长上下文模型在编码与 Agent 场景下的接入成本。
Google Research 提出智能体记忆框架 ReasoningBank,通过同时从成功和失败经验中提炼高层结构化推理模式与防错规则,使 AI 智能体在部署后具备测试时持续自进化能力。结合记忆感知测试时扩展(MaTTS)机制,智能体在 WebArena 和 SWE-bench Verified 评测中任务成功率分别提升 8.3% 与 4.6%,同时显著降低了无效探索步骤。
推荐理由:该研究将测试时扩展与智能体记忆机制结合,为解决智能体重复犯错和缺乏长程自进化能力提供了可落地的闭环框架。
Sebastian Raschka 发文系统阐释了编码智能体与外层脚手架(Harness)的架构设计,并开源了纯 Python 实现的 Mini Coding Agent 项目。
推荐理由:文章系统拆解了代码智能体脚手架的六大核心组件,帮助开发者理解上下文管理与工具链如何补足模型能力。
Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。
推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。
DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。
推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。
DeepSeek 宣布 DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus 版本,并在 Hugging Face 与 ModelScope 同步开源。
推荐理由:官方说明了该版本在语言一致性以及代码和搜索智能体上的针对性改进,并同步公开了开源权重与接口更新。
SemiAnalysis 分析认为 GPT-5 核心的统一路由器不仅优化了推理成本与性能,更为 OpenAI 庞大免费用户群的商业化及打造智能体超级应用奠定了基础。
推荐理由:原文从边际推理成本与动态路由角度剖析商业化路径,读者可据此理解智能体交易抽成与传统搜索广告的本质区别。