跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 241–260 条 · 共 277 条
7月23日周四
  1. Google Research69

    Google 发布 SymptomAI 研究:基于 Gemini 的对话式症状评估智能体

    Google Research 发布基于 Gemini Flash 2.0 的对话式症状评估智能体研究 SymptomAI,在包含 13,917 名参与者的全美规模真实测试中验证了端到端问诊与鉴别诊断能力。

    推荐理由:该研究展示了对话式智能体在万人级真实问诊与鉴别诊断中的准确性,为结合可穿戴设备的日常健康评估提供了可行路径。

  2. Google Research72

    Google 提出基于强化学习的量子控制框架,实现计算过程中的实时连续校准

    Google Quantum AI 与 Google DeepMind 在《Nature》发表论文,提出一种基于强化学习的自主控制框架,使量子计算机能够在执行计算的同时利用量子纠错检测信号实时调节数千个控制参数。

    推荐理由:该研究展示了利用强化学习根据纠错检测信号动态调整控制参数的方法,解决了量子计算机运行期间因硬件漂移必须中断计算进行重新校准的瓶颈。

7月21日周二
7月17日周五
7月16日周四
  1. Hugging Face89

    Hugging Face 披露 2026 年 7 月安全入侵事件

    Hugging Face 披露其生产基础设施遭遇到由自主 AI 智能体系统驱动的入侵攻击,导致部分内部数据集及多组凭据发生未授权访问。攻击者利用数据集处理流程中的远程代码加载及模板注入漏洞获取初始权限并横向移动,公开模型、数据集和软件供应链未受篡改。官方已修复漏洞、轮换凭据并重建节点,并在调查中利用自建部署的开源模型分析了超 1.7 万条攻击日志,同时建议用户轮换访问 Token。

    推荐理由:官方披露了由自主智能体发动的多阶段入侵实况,为防御方提供了本地部署模型应对安全分析与护栏限制的可迁移经验。

  2. Hugging Face71

    IBM Research 解析智能体模型路由的设计挑战与系统优化方法

    IBM Research 发文指出智能体系统中的模型路由并非单纯的模型分类选择,而是需要综合平衡成本、质量与延迟的系统优化问题。实测显示由于上下文缓存大幅降低输入成本,名义单价更高的 Claude Sonnet 4.6 在 AppWorld 测试中总成本为 $79,显著低于 GPT-4.1 的 $155。

    推荐理由:原文通过具体测试数据揭示了缓存机制与系统开销对模型实际成本的影响,为智能体路由设计提供了可参考的系统优化视角。

7月15日周三
7月12日周日
  1. 阶跃 StepFun 公众号66

    阶跃星辰发布 Step Edge 端侧模型家族

    阶跃星辰发布面向手机与汽车等终端场景的 Step Edge 端侧模型家族,涵盖基础模型、Audio、GUI 及 Gen 四类模型。该系列支持低至 0.1 秒的本地 toolcall 执行与全模态隐私保护,并在 29 项核心评测指标中取得领先;官方同时推出了配套的 Step Inference NPU 自研推理引擎以优化终端延迟。

    推荐理由:阶跃星辰面向手机和汽车等场景推出端侧模型家族并配套自研推理引擎,展示了端云协同与本地执行的技术路径。

7月9日周四
  1. Google Research71

    Google 发布 SensorFM:基于万亿分钟可穿戴健康数据的传感器基础模型

    Google Research 推出面向可穿戴健康数据的大型传感器基础模型 SensorFM,基于 500 万受试者超过 1 万亿分钟的多模态无标注传感器数据进行自监督预训练。

    推荐理由:原文展示了利用海量无标注传感器数据预训练基础模型的方法,读者可据此参考时序健康信号的通用表征构建方式。

7月7日周二
  1. Hugging Face70

    Hugging Face 携手微软在 Foundry Managed Compute 上线开源模型托管服务

    Hugging Face 与微软合作在 Microsoft Foundry 中推出 Hugging Face Collection,支持在托管 GPU 平台 Foundry Managed Compute 上一键部署开源权重模型。

    推荐理由:原文给出了预置权重、多引擎托管与统一安全治理的落地架构,读者可以据此评估企业私有化部署开源模型与智能体集成的工程链路。

7月6日周一
  1. Hugging Face70

    Hugging Face Kernels 迎来重大更新:上线内核仓库类型并支持智能体内核开发

    Hugging Face 宣布对 🤗 Kernels 项目进行全面重构与更新,在 Hub 上正式推出了全新的 kernel 仓库类型。新版本引入了受信任发布者机制与基于 Sigstore cosign 的临时私钥代码签名,并将加载工具 kernels 与构建工具 kernel-builder 的 CLI 彻底解耦。

    推荐理由:通过统一内核仓库类型并结合代码签名与受信任发布机制,为底层算力优化与智能体生成内核提供了标准化的安全分发底座。

6月27日周六
6月25日周四
6月24日周三
  1. 通义实验室 公众号77

    通义实验室开源原生语言世界模型 Qwen-AgentWorld

    通义实验室正式开源原生语言世界模型 Qwen-AgentWorld 及其评测基准 AgentWorldBench。该模型基于超 1000 万条真实交互轨迹,经由继续预训练、监督微调和强化学习三阶段训练,覆盖 MCP、Search、Terminal、SWE 等文本类及 Web、OS、Android 等 GUI 类共七大领域。

    推荐理由:模型通过对环境交互显式建模来降低沙箱试错成本,为智能体强化学习和跨任务泛化提供了可控模拟路径。

6月22日周一
  1. The Next Platform68

    HPE 借智能体 AI 浪潮推动企业推理算力回迁本地数据中心

    HPE 将自身支持平台迁移至基于 GreenLake Intelligence 与 Private Cloud AI 的本地基础设施,将运行成本降低 30 倍以上并月省近 10 万美元。

    推荐理由:原文通过实际成本数据揭示了智能体高频交互带来的开销问题,为评估生产级 AI 推理回迁本地数据中心提供了经济性依据。

6月17日周三
  1. 智谱 公众号83

    智谱上线并开源 GLM-5.2:支持 1M 上下文并强化长程编程能力

    智谱正式上线并开源 GLM-5.2 模型,遵循 MIT 协议,主打 1M 上下文与长程编程任务能力。在 FrontierSWE 等基准测试中其表现逼近 Claude Opus 4.8,并通过 IndexShare 架构优化将 1M 上下文下的单位 token FLOPs 降低至 2.9 倍。

    推荐理由:模型主打长程编程任务与长上下文支持,结合架构优化降低推理算力消耗,为长链路软件工程落地提供了开源参考。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI 控制路线图以保障智能体系统安全

    Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与智能体安全技术框架,提出将潜在失齐的 AI 智能体视为内部威胁的系统级纵深防御体系。

    推荐理由:文章提出了将潜在失齐智能体视为内部威胁的系统级防御框架,为自主系统的实时监督与分级拦截提供了落地参考。

6月9日周二
  1. Google DeepMind83

    Google DeepMind 推出统一无编码器多模态模型 Gemma 4 12B

    Google DeepMind 推出统一且无独立编码器的多模态模型 Gemma 4 12B,支持原生音频与视觉输入,采用 Apache 2.0 协议开源。该模型移除了传统的图像和音频编码器,直接将多模态信号投影至 LLM 主干,性能接近 26B MoE 模型而内存占用减少超过一半,仅需 16GB 显存或统一内存即可在笔记本电脑本地运行。

    推荐理由:模型移除了传统独立的模态编码器并直接接入语言主干,展示了在消费级硬件上兼顾原生音画输入与推理效率的轻量化方案。

  2. 通义实验室 公众号74

    Qwen3.7-Max 仅凭调研文档从 0 交付移动与 Web 双端应用

    通义实验室联合 Efflora 团队完成技术验证,仅凭一份约 15 万字的产品调研文档,由 Qwen3.7-Max 在无人工接管下用时约 4 小时全自动交付移动端与 Web 端两套可运行应用。

    推荐理由:文章详细拆解了将界面像素坐标转化为硬约束及多层验收闭环的工程实践,为大模型长程代码交付提供了可迁移的控制方法。

6月6日周六
  1. Sebastian Raschka62

    Sebastian Raschka 盘点 2026 年上半年大语言模型研究论文清单

    Sebastian Raschka 发布了 2026 年 1 月至 5 月的精选大语言模型研究论文清单,重点关注混合架构、推理与强化学习等领域。文章指出今年架构设计不再局限于扩大 Transformer 规模,而是转向注意力层与 Mamba-2 或 Gated DeltaNet 交替的混合架构以提升长上下文效率。

    推荐理由:作者整理了前五个月核心论文与架构趋势,读者可快速掌握混合架构与长上下文演进方向。