跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 101–120 条 · 共 121 条
5月16日周六
  1. Sebastian Raschka65

    大语言模型架构最新进展:KV 共享、mHC 与压缩注意力

    Sebastian Raschka 梳理了解读近期开源大语言模型在长上下文效率上的核心架构演进。文章重点分析了 Gemma 4 的跨层 KV 共享与分层嵌入(PLE)、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力(CCA),以及 DeepSeek V4 采用的流形约束超连接(mHC)与 CSA/HCA 混合压缩注意力。

    推荐理由:原文系统梳理了主流开源大模型在长上下文下的架构改进,读者可据此理解降低 KV 缓存与计算开销的设计取舍。

  2. Google DeepMind62

    Google DeepMind 与斯坦福利用 Co-Scientist 筛选出肝纤维化候选药物

    斯坦福大学医学院团队利用 Google DeepMind 的 Co-Scientist 从海量文献中筛选老药新用以治疗肝纤维化,相关成果发表于 Advanced Science。

    推荐理由:斯坦福团队通过活体人类肝细胞实验验证了 Co-Scientist 筛选老药的能力,为 AI 辅助药物重定向提供了直接对比与实验数据。

  3. Google DeepMind72

    WeatherNext 如何协助美国国家飓风中心预测飓风梅丽莎在牙买加的登陆

    Google DeepMind 披露了气象 AI 模型 WeatherNext 协助美国国家飓风中心(NHC)预测 2025 年 10 月飓风梅丽莎(Hurricane Melissa)的细节,该模型提前 5 天预测出该风暴将从弱热带低压急剧增强为 5 级飓风并在牙买加登陆。

    推荐理由:原文结合实战案例展示了气象大模型如何同时兼顾路径与强度预测,读者可据此了解 AI 在极端天气预警中的落地范式。

  4. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash:主打智能体与编程能力,输出速度提升 4 倍

    Google DeepMind 正式推出 Gemini 3.5 系列并首发上线 Gemini 3.5 Flash,重点强化复杂长程智能体与编程工作流能力。该模型在 Terminal-Bench 2.1(76.2%)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度达到其他前沿模型的 4 倍。

    推荐理由:原文给出了模型在智能体与编程基准上的性能表现及吞吐速度对比,读者可以据此评估其作为生产环境主力模型的调用效率与成本。

5月12日周二
5月6日周三
  1. Google DeepMind71

    Google DeepMind 复盘 AlphaEvolve:Gemini 驱动的编码智能体如何在多领域拓展落地成效

    Google DeepMind 复盘了由 Gemini 驱动的算法设计编码智能体 AlphaEvolve 推出一年以来的应用进展,该系统已转为 Google 核心基础设施组件。

    推荐理由:原文详细梳理了编码智能体从基础算法拓展到芯片设计与商业优化的具体数据,读者可以据此评估 AI 辅助算法探索在各行业落地的实际深度。

4月30日周四
4月27日周一
  1. Google DeepMind61

    Google DeepMind 宣布与韩国达成 AI 战略合作

    Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)达成合作,将在首尔设立 AI Campus 以支持当地科研机构接入其前沿科学 AI 模型。合作将联合首尔大学与韩国科学技术院等机构,探索应用 AlphaEvolve、AlphaGenome、AlphaFold 与 AI co-scientist 等模型,并推进人才实习及与韩国 AI 安全研究所(AISI)的安全研究。

    推荐理由:原文明确了双方围绕科研模型接入、AI Campus 建设与安全研究的落地形式,读者可据此了解前沿 AI 实验室与国家科研体系的合作范式。

4月23日周四
  1. Google Research72

    Google Photos 上线基于 3D 场景估计与生成式 AI 的照片视角重构功能

    Google 宣布在 Google Photos 的 Auto frame 中上线基于 3D 场景理解与生成式 AI 的照片重构功能,支持在拍摄后自动调整人像照片的相机机位和焦距。

    推荐理由:原文展示了解耦 3D 场景估计与扩散模型以重构相机视角的方案,有助于了解生成式 AI 在后期构图与人像畸变修复中的落地细节。

4月22日周三
  1. Google DeepMind75

    Google DeepMind 发布 Decoupled DiLoCo:跨远距离数据中心的弹性分布式 AI 训练架构

    Google DeepMind 提出全新分布式训练架构 Decoupled DiLoCo,通过异步数据流将大规模训练解耦到独立的算力单元中,实现跨全球数据中心的高容错与低通信开销训练。

    推荐理由:原文给出了跨数据中心训练的异步解耦方案和实测数据,读者可以了解如何在低广域网带宽与异构硬件条件下维持高效预训练。

  2. Google Research65

    Google 提出智能体记忆框架 ReasoningBank:从成败经验中提炼推理模式实现测试时自进化

    Google Research 提出智能体记忆框架 ReasoningBank,通过同时从成功和失败经验中提炼高层结构化推理模式与防错规则,使 AI 智能体在部署后具备测试时持续自进化能力。结合记忆感知测试时扩展(MaTTS)机制,智能体在 WebArena 和 SWE-bench Verified 评测中任务成功率分别提升 8.3% 与 4.6%,同时显著降低了无效探索步骤。

    推荐理由:该研究将测试时扩展与智能体记忆机制结合,为解决智能体重复犯错和缺乏长程自进化能力提供了可落地的闭环框架。

4月16日周四
  1. Google DeepMind75

    Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持原生多说话人对话与 70 多种语言。该模型引入了音频标签功能,允许用户在输入文本中嵌入自然语言指令来精确控制语音风格、语速与停顿,在 Artificial Analysis TTS 榜单上取得了 1211 的 Elo 分数。

    推荐理由:模型引入自然语言音频标签来实现句中语气与语速控制,为开发者精细调节多角色拟真对话提供了直接参考。

4月13日周一
4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布开源模型 Gemma 4:覆盖端侧与桌面规模并采用 Apache 2.0 协议

    Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。

    推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。

3月29日周日
  1. Google DeepMind68

    Google DeepMind 探索 AI 时代鼠标指针交互:结合 Gemini 实现即指即问

    Google DeepMind 推出由 Gemini 驱动的 AI 指针交互方案与实验 Demo,使用户无需切换窗口或编写复杂提示词,直接通过指向屏幕内容并配合简短语音即可完成操作。

    推荐理由:原文阐述了结合视觉上下文与多模态理解的指针交互设计,读者可据此了解系统如何将传统指针操作升级为无缝的 AI 上下文触发入口。

3月25日周三
  1. Google Research67

    Google 推出 Vibe Coding XR:结合 Gemini 与 XR Blocks 加速空间计算原型开发

    Google 推出 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,支持用户用自然语言在 60 秒内生成具备物理交互感知的 Android XR 应用原型。

    推荐理由:展示了如何通过长上下文推理与预置代码模板,将自然语言直接转化为具备空间物理交互的XR应用。

3月19日周四
  1. Google Infrastructure73

    Google 数据中心需求响应签约容量达 1 GW

    Google 宣布已在与美国多家电力公用事业公司的长期合同中累计整合 1 GW 数据中心需求响应容量。该方案允许 Google 在用电高峰时段限制或转移部分机器学习(ML)工作负载,以平抑整体用电负荷并稳定电网。

    推荐理由:通过调度机器学习负载实现 1 GW 电网需求响应,为高能耗算力中心缓解电网并网瓶颈提供了具体落地范例。

3月18日周三
  1. Google Research71

    Google 联合英国 NHS 评估乳腺癌筛查 AI 系统在双读流程中的可行性

    Google 联合英国 NHS 在《Nature Cancer》发表两项研究,评估了乳腺癌筛查 AI 系统的独立性能及其融入临床双读工作流的可行性。在涵盖超 11 万名女性的回溯性与前瞻性测试中,AI 独立运行时的癌症检出率从每千人 7.54 例提升至 9.33 例,并检出 25% 原双读流程漏诊的间期癌。

    推荐理由:研究通过超十万例真实筛查数据验证了算法替代第二阅片人的非劣效性,展示了医疗诊断场景下人机协同与工作流落地的量化路径。

3月12日周四
  1. Google Research61

    Google 推出 Groundsource 框架并开源 260 万条全球突发洪水数据集

    Google 推出 Groundsource 框架,利用 Gemini 将多语言新闻报道转化为结构化的自然灾害历史数据,并公开发布包含 150 多个国家、260 万条记录的城市突发洪水数据集。

    推荐理由:该成果展示了利用大语言模型从全球多语言新闻中批量提取高精度时空历史数据的工程化路径。