跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 261–269 条 · 共 269 条
5月6日周三
  1. Google DeepMind71

    Google DeepMind 复盘 AlphaEvolve:Gemini 驱动的编码智能体如何在多领域拓展落地成效

    Google DeepMind 复盘了由 Gemini 驱动的算法设计编码智能体 AlphaEvolve 推出一年以来的应用进展,该系统已转为 Google 核心基础设施组件。

    推荐理由:原文详细梳理了编码智能体从基础算法拓展到芯片设计与商业优化的具体数据,读者可以据此评估 AI 辅助算法探索在各行业落地的实际深度。

4月30日周四
4月24日周五
  1. DeepSeek 公众号93

    DeepSeek-V4 预览版上线并开源:标配 1M 上下文,推出 Pro 与 Flash 双版本

    DeepSeek 正式上线并开源全新系列模型 DeepSeek-V4 预览版,全系标配 1M 上下文,提供 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本。

    推荐理由:原文给出了两个版本的性能定位、架构优化细节与接口迁移时间表,读者可以据此评估长上下文模型在编码与 Agent 场景下的接入成本。

4月22日周三
  1. Google Research65

    Google 提出智能体记忆框架 ReasoningBank:从成败经验中提炼推理模式实现测试时自进化

    Google Research 提出智能体记忆框架 ReasoningBank,通过同时从成功和失败经验中提炼高层结构化推理模式与防错规则,使 AI 智能体在部署后具备测试时持续自进化能力。结合记忆感知测试时扩展(MaTTS)机制,智能体在 WebArena 和 SWE-bench Verified 评测中任务成功率分别提升 8.3% 与 4.6%,同时显著降低了无效探索步骤。

    推荐理由:该研究将测试时扩展与智能体记忆机制结合,为解决智能体重复犯错和缺乏长程自进化能力提供了可落地的闭环框架。

4月4日周六
4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布开源模型 Gemma 4:覆盖端侧与桌面规模并采用 Apache 2.0 协议

    Google DeepMind 正式发布开源模型系列 Gemma 4,基于 Gemini 3 架构与技术打造,采用 Apache 2.0 协议开源。Gemma 4 提供 Effective 2B(E2B)、Effective 4B(E4B)、仅激活 3.8B 参数的 26B MoE 以及 31B Dense 四种尺寸,全系原生支持图像与视频处理,端侧小模型额外支持原生音频输入。

    推荐理由:系列模型采用 Apache 2.0 协议并覆盖端侧到桌面规模,为开发者提供了兼顾多模态与推理的轻量部署方案。

12月1日周一
  1. DeepSeek 公众号93

    DeepSeek 发布 V3.2 正式版与 V3.2-Speciale 模型并开源

    DeepSeek 正式发布并开源 DeepSeek-V3.2 与长思考增强版 DeepSeek-V3.2-Speciale 两个正式版模型,网页端、App 和 API 已同步更新。DeepSeek-V3.2 首次支持在思考模式下进行多轮工具调用,并适配了 Claude Code;Speciale 版本专注于高难度数学与逻辑推理,目前以限时 API 服务形式开放给社区评测。

    推荐理由:官方正式发布两款新模型并开源权重,重点实现了思考推理与工具调用的深度结合,并同步更新了服务接口。

9月22日周一
8月13日周三
  1. SemiAnalysis · 算力产业70

    SemiAnalysis 分析 GPT-5 路由机制如何铺垫商业化与超级应用

    SemiAnalysis 分析认为 GPT-5 核心的统一路由器不仅优化了推理成本与性能,更为 OpenAI 庞大免费用户群的商业化及打造智能体超级应用奠定了基础。

    推荐理由:原文从边际推理成本与动态路由角度剖析商业化路径,读者可据此理解智能体交易抽成与传统搜索广告的本质区别。