Google 发布 Science One 框架:基于证据链的可验证自主科研系统
Google Research 推出基于“证据链”(Chain-of-Evidence, CoE)的自主科研系统 Science One Framework,解决 AI 科研智能体常见的虚构引用、代码与文本不符及实验不可复现等结构性问题。
推荐理由:针对自主科研智能体虚构文献与代码方法脱节的痛点,原文提出原生证据链架构与审计协议,为科研智能体的可验证性提供了系统化方案。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Google Research 推出基于“证据链”(Chain-of-Evidence, CoE)的自主科研系统 Science One Framework,解决 AI 科研智能体常见的虚构引用、代码与文本不符及实验不可复现等结构性问题。
推荐理由:针对自主科研智能体虚构文献与代码方法脱节的痛点,原文提出原生证据链架构与审计协议,为科研智能体的可验证性提供了系统化方案。
微软研究院推出 Echoverse,通过构建 10 个深度领域环境和 2 个专项能力世界,以真实数据库状态交互和校验器协同演进训练 Computer-Use 智能体。
推荐理由:研究展示了高保真状态交互和数据库级校验对智能体泛化的核心作用,为闭环环境训练提供了可复现的评测与演进范式。
Google Research 发布基于 Gemini Flash 2.0 的对话式症状评估智能体研究 SymptomAI,在包含 13,917 名参与者的全美规模真实测试中验证了端到端问诊与鉴别诊断能力。
推荐理由:该研究展示了对话式智能体在万人级真实问诊与鉴别诊断中的准确性,为结合可穿戴设备的日常健康评估提供了可行路径。
Google Quantum AI 与 Google DeepMind 在《Nature》发表论文,提出一种基于强化学习的自主控制框架,使量子计算机能够在执行计算的同时利用量子纠错检测信号实时调节数千个控制参数。
推荐理由:该研究展示了利用强化学习根据纠错检测信号动态调整控制参数的方法,解决了量子计算机运行期间因硬件漂移必须中断计算进行重新校准的瓶颈。
Google Research 提出一种在冻结权重基础上集成多 Token 预测(MTP)头的端侧推理加速架构,已部署于 Pixel 9 与 10 系列设备。
推荐理由:阐述了在不重训基座模型的前提下通过跨注意力复用缓存实现端侧投机解码,为移动设备内存与能耗受限场景提供了可落地的加速方案。
Google Research 发文揭示了大语言模型通过推理链(CoT)召回单跳事实类参数化知识的核心机制。在 Gemini-2.5 和 Qwen3-32B 等模型上的实验表明,即使面对无须逻辑拆解的简单事实问答,开启推理也能显著提升召回率,其动力来自额外 token 提供的计算缓冲效应以及生成相关背景事实的事实启动效应。
推荐理由:研究解构了思考过程辅助大模型召回参数化知识的机制,为理解推理模型的能力边界与中间步骤优化提供了实验依据。
Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与智能体安全技术框架,提出将潜在失齐的 AI 智能体视为内部威胁的系统级纵深防御体系。
推荐理由:文章提出了将潜在失齐智能体视为内部威胁的系统级防御框架,为自主系统的实时监督与分级拦截提供了落地参考。
Google 支持加州大学圣迭戈分校开展手机集群计算研究,计划利用 2000 部退役 Pixel 手机的主板搭建低碳云算力中心。该方案剥离电池和屏幕以降低安全隐患并保留占内含碳约 50% 的主板,替换为通用 Linux 系统后通过 Kubernetes 进行容器化调度,25 至 50 部手机即可提供等效于一台现代服务器的算力。
推荐理由:方案通过拆解退役手机主板构建分布式计算集群,为数据中心降低硬件制造阶段的内含碳排放提供了可行的硬件再利用路径。
Google DeepMind 发布在塞拉利昂开展的预注册对照试验结果,使用基于 LearnLM 调优的 Guided Learning 辅助教学让学生数学成绩提升 0.258 个标准差,相当于 8 周内取得了 1.2 至 1.7 年的正常学习进展。
推荐理由:这项预注册对照试验用翔实数据验证了苏格拉底式引导在基础教育中的提分效果与师生交互模式。
Google Research 在 Nature 发表论文推出 PHRM 研究系统,利用智能手机前置摄像头在人脸解锁后自动采集面部视频,通过端侧深度学习算法被动估算心率与每日静息心率。
推荐理由:该研究展示了利用手机前置摄像头实现全肤色被动心率监测的技术方案,为无穿戴设备的日常健康追踪提供了实用参考。
Google 宣布其实验研究辅助系统 ERA(Empirical Research Assistance)论文在 Nature 正式发表,并开始通过 Gemini for Science 逐步开放基于 ERA 和 AlphaEvolve 构建的实验工具 Computational Discovery。
推荐理由:原文展示了结合树搜索与大模型自动编写并优化科研代码的方法,为多学科计算实验的自动化提供了实测参考。
斯坦福大学医学院团队利用 Google DeepMind 的 Co-Scientist 从海量文献中筛选老药新用以治疗肝纤维化,相关成果发表于 Advanced Science。
推荐理由:斯坦福团队通过活体人类肝细胞实验验证了 Co-Scientist 筛选老药的能力,为 AI 辅助药物重定向提供了直接对比与实验数据。
Google DeepMind 宣布推出 AI co-clinician 医疗 AI 研究倡议,探索在医生监督下让多模态 AI 智能体协同参与患者诊疗的“三方医疗”模式。
推荐理由:研究展示了结合实时音视频的多模态医疗智能体架构,为评估 AI 辅助问诊与临床安全边界提供了详细测试数据。
Google DeepMind 提出全新分布式训练架构 Decoupled DiLoCo,通过异步数据流将大规模训练解耦到独立的算力单元中,实现跨全球数据中心的高容错与低通信开销训练。
推荐理由:原文给出了跨数据中心训练的异步解耦方案和实测数据,读者可以了解如何在低广域网带宽与异构硬件条件下维持高效预训练。
Google Research 提出智能体记忆框架 ReasoningBank,通过同时从成功和失败经验中提炼高层结构化推理模式与防错规则,使 AI 智能体在部署后具备测试时持续自进化能力。结合记忆感知测试时扩展(MaTTS)机制,智能体在 WebArena 和 SWE-bench Verified 评测中任务成功率分别提升 8.3% 与 4.6%,同时显著降低了无效探索步骤。
推荐理由:该研究将测试时扩展与智能体记忆机制结合,为解决智能体重复犯错和缺乏长程自进化能力提供了可落地的闭环框架。
Google 联合英国 NHS 在《Nature Cancer》发表两项研究,评估了乳腺癌筛查 AI 系统的独立性能及其融入临床双读工作流的可行性。在涵盖超 11 万名女性的回溯性与前瞻性测试中,AI 独立运行时的癌症检出率从每千人 7.54 例提升至 9.33 例,并检出 25% 原双读流程漏诊的间期癌。
推荐理由:研究通过超十万例真实筛查数据验证了算法替代第二阅片人的非劣效性,展示了医疗诊断场景下人机协同与工作流落地的量化路径。
Google 与 Beth Israel Deaconess Medical Center(BIDMC)合作完成了一项前瞻性单中心可行性研究,评估对话式医疗 AI 模型 AMIE 在门诊就诊前采集病史的实际表现。
推荐理由:该研究展示了对话式医疗模型从模拟环境走向真实门诊预诊的可行性与安全性数据。