Google DeepMind 复盘 AlphaEvolve:Gemini 驱动的编码智能体如何在多领域拓展落地成效
Google DeepMind 复盘了由 Gemini 驱动的算法设计编码智能体 AlphaEvolve 推出一年以来的应用进展,该系统已转为 Google 核心基础设施组件。
推荐理由:原文详细梳理了编码智能体从基础算法拓展到芯片设计与商业优化的具体数据,读者可以据此评估 AI 辅助算法探索在各行业落地的实际深度。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Google DeepMind 复盘了由 Gemini 驱动的算法设计编码智能体 AlphaEvolve 推出一年以来的应用进展,该系统已转为 Google 核心基础设施组件。
推荐理由:原文详细梳理了编码智能体从基础算法拓展到芯片设计与商业优化的具体数据,读者可以据此评估 AI 辅助算法探索在各行业落地的实际深度。
Google DeepMind 宣布推出 AI co-clinician 医疗 AI 研究倡议,探索在医生监督下让多模态 AI 智能体协同参与患者诊疗的“三方医疗”模式。
推荐理由:研究展示了结合实时音视频的多模态医疗智能体架构,为评估 AI 辅助问诊与临床安全边界提供了详细测试数据。
DeepSeek 正式上线并开源全新系列模型 DeepSeek-V4 预览版,全系标配 1M 上下文,提供 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本。
推荐理由:原文给出了两个版本的性能定位、架构优化细节与接口迁移时间表,读者可以据此评估长上下文模型在编码与 Agent 场景下的接入成本。
Google Research 提出智能体记忆框架 ReasoningBank,通过同时从成功和失败经验中提炼高层结构化推理模式与防错规则,使 AI 智能体在部署后具备测试时持续自进化能力。结合记忆感知测试时扩展(MaTTS)机制,智能体在 WebArena 和 SWE-bench Verified 评测中任务成功率分别提升 8.3% 与 4.6%,同时显著降低了无效探索步骤。
推荐理由:该研究将测试时扩展与智能体记忆机制结合,为解决智能体重复犯错和缺乏长程自进化能力提供了可落地的闭环框架。
Sebastian Raschka 发文系统阐释了编码智能体与外层脚手架(Harness)的架构设计,并开源了纯 Python 实现的 Mini Coding Agent 项目。
推荐理由:文章系统拆解了代码智能体脚手架的六大核心组件,帮助开发者理解上下文管理与工具链如何补足模型能力。
Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。
推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。
DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。
推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。
DeepSeek 宣布 DeepSeek-V3.1 更新至 DeepSeek-V3.1-Terminus 版本,并在 Hugging Face 与 ModelScope 同步开源。
推荐理由:官方说明了该版本在语言一致性以及代码和搜索智能体上的针对性改进,并同步公开了开源权重与接口更新。
SemiAnalysis 分析认为 GPT-5 核心的统一路由器不仅优化了推理成本与性能,更为 OpenAI 庞大免费用户群的商业化及打造智能体超级应用奠定了基础。
推荐理由:原文从边际推理成本与动态路由角度剖析商业化路径,读者可据此理解智能体交易抽成与传统搜索广告的本质区别。