跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 161–180 条 · 共 273 条
9月28日周一
  1. Cloudflare Blog · 网络基础设施69

    Cloudflare 2026 年度创始人公开信:自动化流量已超人类流量,AI 智能体正重塑网络生态

    Cloudflare 联合创始人 Matthew Prince 发布 2026 年度公开信,指出在 AI 智能体与爬虫推动下,自动化网络流量已在 2026 年 5 月超越人类流量,并预计未来 5 年内达到人类流量的 1000 倍。

    推荐理由:原文基于平台数据揭示了自动化流量已超人类流量的转折点,读者可据此理解智能体普及对网络生态与流量成本的影响。

9月26日周六
  1. GitHub Blog · AI 与安全70

    GitHub Copilot 教程:如何使用画布构建自定义工作流

    GitHub Copilot 现支持通过 /create-canvas 技能利用自然语言描述直接生成双向交互画布,用于搭建看板、Issue 分流板或发布清单等工作流界面。用户与 AI 智能体可以实时共享并修改画布状态,无需手动编写布局代码即可同步更新数据。生成的画布支持保存为扩展在团队内复用,社区也已在 Awesome Copilot 中提供了一系列开箱即用的预设模板。

    推荐理由:文章介绍了用自然语言生成双向交互界面的方法,开发者可据此将单向命令交互改造为可实时协同的看板工作流。

  2. Simon Willison64

    John Gruber 评 Meta 智能体 Muse:看似可爱但暗藏安全风险

    John Gruber 评价 Meta 推出的消费级智能体系统 Muse,指出其在技术上为每位用户在 Meta 云端提供独立的持久化 Linux 虚拟机,并以易用的可爱吉祥物形象包装。但他警告称消费者可能并未意识到该系统的强大与危险性,尤其是当它在 Mac 上运行时。

    推荐理由:原文指出了消费级智能体包装亲民背后的安全风险,读者可以据此审视高权限系统对普通用户的潜在威胁。

9月25日周五
  1. GitHub Blog · AI 与安全65

    GitHub 探讨 AI 交互界面:为什么对话框往往不是最佳选择

    GitHub 官方博客探讨了纯对话框作为大语言模型主要交互界面的局限性,并介绍了 GitHub Copilot app 中的 canvas 功能。Canvas 是运行在 Copilot 内部的全栈应用界面,支持与 Copilot agent 进行双向通信并在本地执行代码。作者指出,让智能体构建可视化工具而不是在聊天框中处理所有琐碎指令,能有效避免 token 浪费并更好地自动化开发流程。

    推荐理由:文章探讨了纯聊天框在智能体交互中的局限,展示了用自定义全栈界面替代重复对话来降低 token 消耗的方法。

  2. Google Research64

    Google 提出 AI 视频联合导演框架,推进长时长连贯视频生成

    Google Research 推出一套面向长时长叙事视频的多智能体框架体系,涵盖 Co-Director、CANVAS、A²RD 和 VQQA 四项核心研究,旨在解决视频扩散模型在多镜头场景中的语义漂移和级联错误。

    推荐理由:Google 将长视频生成解构为多智能体编排与世界状态追踪,提供了解决多镜头叙事中角色与场景漂移的成套系统方案。

  3. GitHub Blog · AI 与安全74

    GitHub Security Lab 开源 AI 模糊测试工具 Fuzzing Taskflow

    GitHub Security Lab 推出基于 Taskflow Agent 的自主模糊测试流水线 Fuzzing Taskflow,可全自动完成 C/C++ 项目的代码入口识别、Harness 编写、AFL++ 执行与崩溃分类。该框架将大语言模型的调度决策与 MCP 工具执行解耦,内置覆盖率反馈驱动的用例迭代与结构感知变异机制,并在测试结束后自动生成包含根本原因分析和修复补丁建议的漏洞报告。

    推荐理由:展示了将大模型决策与工具执行解耦的自动化模糊测试闭环设计,为软件安全工程提供了实用的落地参考。

  4. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时对话能力与低延迟流式视频生成结合,赋予对话 AI 具备自然口型与表情的动态视觉形象。

    推荐理由:原文介绍了原生实时对话结合流式数字人形象的能力与技术细节,读者可以据此了解多模态交互在企业场景中的最新落地形式。

9月24日周四
  1. Engineering at Meta67

    Meta 为 AI 眼镜引入机密计算基础设施 Private Processing

    Meta 宣布将机密计算基础设施 Private Processing 扩展至 Meta AI 眼镜,把眼镜端的信任边界延伸至云端机密虚拟机(CVM),确保即使处理高负载 AI 任务,Meta 也无法访问用户数据。

    推荐理由:原文给出了 AI 眼镜在端云协同中兼顾长期记忆与机密计算的架构设计,有助于了解端侧智能硬件在云端大模型算力卸载时的隐私安全方案。

9月23日周三
  1. AWS News · 云基础设施75

    AWS 推出 Amazon CloudWatch Omni 为生成式 AI 与智能体提供专用可观测性

    AWS 正式推出 Amazon CloudWatch Omni,为生成式 AI 和 AI 智能体工作负载提供跨模型与框架的统一可观测、评估及实验方案。该方案提供 VS Code 与 Kiro 原生 IDE 插件以及独立 Web 界面,内置 17 种评估指标,支持分步追踪 LLM 与工具调用、提示词版本对比及自动化回归测试。IDE 插件免费提供且支持纯本地开发,无需 AWS 账号即可开始使用。

    推荐理由:AWS 将智能体追踪与评估能力内嵌到 IDE 和独立 Web 界面中,让开发者无需登录控制台即可排查非确定性调用问题。

  2. Anthropic News(RSS)75

    Claude 自主发现类似 CRISPR 重复序列的新型酶系统 ART

    Anthropic 生命科学团队宣布,Claude 智能体在噬菌体基因数据中自主发现了一种具有类似 CRISPR 重复序列的新型酶系统 ART。约 950 个 Claude 智能体在 21 小时内消耗 2.1 亿 token 筛选了超过 20 万个逆转录酶序列,最终锁定了包含逆转录酶、辅助蛋白和重复序列特征的新系统。团队已通过湿实验验证该序列可表达为多条短 RNA,并公开发布了相关预印本。

    推荐理由:展示了多智能体自主挖掘海量基因数据并提出科学假说的端到端协作流程,为大模型驱动基础生物学研究提供了具体范式。

9月22日周二
  1. 阶跃 StepFun 公众号65

    阶跃星辰 Step 5 Preview 正式上线 TRAE

    阶跃星辰宣布 Step 5 Preview 正式上线豆包旗下 AI 开发工具 TRAE,用户可在全流程开发工作流中直接调用。该模型覆盖 9 类任务与 33 种编程语言,支持代码库理解、跨文件修改、重构与持续数小时的长程任务推进,官方公布其 DeepSWE 得分为 67.7 分,ProgramBench 通过率为 80.5%。

    推荐理由:阶跃星辰将 Step 5 Preview 接入 TRAE 开发环境,并给出了该模型在 33 种编程语言下的代码评测数据。

  2. NVIDIA · AI 筛选71

    NVIDIA 发布 Isaac ROS 5.0,引入智能体工作流与物理 AI 支持

    NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。

    推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。

9月21日周一
9月20日周日
  1. 阶跃 StepFun 公众号75

    阶跃发布旗舰模型 Step 5 Preview

    阶跃星辰发布面向 Agentic 任务的旗舰模型 Step 5 Preview,即日起全量开放 API 与在线体验,并定于 10 月 15 日正式释放模型权重。

    推荐理由:原文给出了稀疏架构与长程任务的具体指标,读者可以据此评估其在复杂工程与专业研究中的能效表现。

9月18日周五
9月17日周四
  1. 月之暗面 Kimi 公众号70

    Kimi 发布金融行业解决方案

    月之暗面正式推出 Kimi 金融行业解决方案,整合了 10 余个权威数据源、9 项专属金融技能和 5 项合规安全措施。该方案通过 MCP 接入 Wind 万得、东方财富与标普全球等数据源,提供财务建模、研报生成和交互式图表等端到端交付能力,并支持通过 Computer Use 联动本地软件。此外,方案联合中信建投证券共建风险评估网关,通过数据分类分级、授权拦截和责任审计实现合规业务落地。

    推荐理由:方案通过 MCP 接入数据源并封装出九项金融技能,为智能体在强合规与高密度投研场景的落地提供了具体工作流范式。