跳到正文

#MCP/工具调用

今日 44 条
今天9月30日周三
  1. 量子位68

    斯坦福推出 HomeBody:GPT-6 Astra 接入宇树 G1 完成厨房探索与整理任务

    斯坦福团队推出具身智能项目 HomeBody,通过 GPT-6 Astra 调度宇树 G1 人形机器人完成未知厨房的探索与整理任务。系统让大语言模型直接以工具调用方式调度导航、抓取、开抽屉等预封装技能库,并结合激光雷达 SLAM 与 Isaac Sim 建立空间记忆,无需针对新环境重新训练专用动作策略。

    推荐理由:介绍了将大模型与机器人技能库解耦的架构设计,读者可借此理解大模型如何通过工具调用和空间记忆完成长程具身任务。

  2. arXiv 人工智能46

    技能何时能带来增益?面向选择性技能调用的任务条件增益预测框架 SkillDelta

    研究人员提出 SkillDelta 框架,通过对比同一 AI 智能体在使用与不使用技能时的成对历史执行数据,在无需重新训练智能体的情况下预测特定任务的技能增益。在 5 个基准测试和 3 个目标智能体的 15 种设置中,SkillDelta 相比随机激活技能在全部设置下均提升了任务成功率,平均绝对增益达 4.3%,有效避免了无效技能带来的性能损耗与额外 token 成本。

  3. arXiv 人工智能42

    迈向代码 API 的交互式理解

    研究人员提出 PAU 基准,通过仅提供黑盒 API 级交互访问,评估 AI 智能体对 Python 代码片段功能的无监督理解能力。评测显示前沿模型普遍表现吃力,表现最佳的 Claude-4-Opus 仍无法理解超过 45% 的测试集,主因在于过度自信导致探索不足。借鉴机器人学习的 AAC 范式后训练后,微调后的 Qwen3-8B 性能追平了 GPT-5-mini。

  4. arXiv 人工智能41

    EmailBench:评估企业邮件与生产力任务中 LLM 智能体的基准

    研究团队推出评测基准 EmailBench,在 16 个类别的 206 个企业邮件与生产力场景中评估 LLM 智能体。该基准采用 258 个可执行静态断言与 211 个 LLM 评分标准,对 8 种语言模型配置展开测试。结果显示最佳配置的场景通过率仅为 33.5%,尽管其 99.7% 的工具调用无 API 故障,表明有效工具执行并不等同于任务完成。

  5. Cerebras 官方博客(网页)73

    Cerebras 探讨 MCP 与 CLI 之争:核心在于速度与执行基础设施

    针对 Perplexity 宣布从 MCP 回退至 API 和 CLI 引发的争议,Cerebras 撰文分析认为两者的核心分歧在于运行时速度与安全可审计性之间的权衡。

    推荐理由:文章梳理了 MCP 与 CLI 在延迟和安全上的权衡,并指出通过低延迟推理与轻量执行环境可以缓解协议带来的性能开销。

  6. Cerebras 官方博客(网页)76

    Cerebras 分享多智能体工作流构建经验与 5 种实用设计模式

    Cerebras 官方博客总结了构建多智能体工作流的实战经验,提出将单智能体拆解为“主厨(调度器)与配菜工(子智能体)”协作架构,以解决单智能体容易触碰的上下文膨胀和失败率过高问题。

    推荐理由:原文通过厨房主厨与配菜工的比喻系统梳理了 5 种多智能体设计模式,读者可以据此将复杂 AI 编码任务拆解为轻量上下文并行与验证工作流。

  7. Cerebras 官方博客(网页)51

    基于 Codex 与 Figma MCP 的多智能体网页设计复刻实践

    作者分享了使用 Codex 结合 Figma MCP 将任意网页自动复刻为 Figma 规范设计稿的实践工作流。针对单智能体面临的 64k–128k 上下文爆炸、运行死循环及工具调用错误等问题,方案通过主编排智能体并发调度单页面子智能体,并加载专门的 Figma write skill,最终在 5 分钟内完成了 5 个页面的高精度复刻。

  8. LlamaIndex 官方博客(网页)64

    LlamaIndex 推出 Parse Gateway:支持按页面复杂度智能路由文档解析器

    LlamaIndex 推出 Parse Gateway Web 应用,基于 LiteParse 的 is_complex 功能实现页面级别的文档解析智能路由。系统会依据无文本、扫描件、乱码或多列复杂排版等信号及严重程度,将简单页面交给免费进程内运行的 LiteParse 处理,复杂页面则自动升级并路由至不同档位的 LlamaParse。

    推荐理由:通过在页面级评估文档复杂度并将不同页面路由至对应解析层级,在保障复杂页面提取质量的同时有效降低了整体延迟与处理成本。

  9. Cerebras 官方博客(网页)66

    Cerebras 发布 AI 生成美观 UI 的实用方法指南

    Cerebras 总结了利用 AI 生成高质量 UI 的 8 种实践方法,以解决通用提示词容易产出千篇一律 SaaS 仪表盘与卡片嵌套的问题。核心方案包括接入 shadcn/ui 的 MCP 服务器以读取真实组件源码、在编码前通过 Design Tokens 与 Tailwind 配置固化视觉规范,以及结合视觉模型截图进行小步精准迭代。

    推荐理由:原文总结了 AI 生成 UI 的典型缺陷与 8 种实用改进方法,读者可据此建立更具约束力的高效前端开发工作流。

  10. Cerebras 官方博客(网页)64

    Cerebras 解析构建 AI Agent 循环机制为何必须依赖验证器

    Cerebras 深入分析了 AI Agent 自主循环机制(Loop)的演进,指出循环的核心在于引入可靠的验证器(Verifiers)而非单纯追求自主性。随着多模态视觉检查能力、MCP 等工具调用协议以及超高速推理的成熟,Agent 能够自主比对输出并低成本迭代修复;同时开发者必须设定明确的完成标准与禁止规则,以避免循环陷入死循环或投机作弊。

    推荐理由:原文梳理了自主循环工作流依赖多模态验证器与高速推理的演进逻辑,为构建防失控的 Agent 提供了实践参考。

  11. LlamaIndex 官方博客(网页)67

    LlamaIndex 提出即时智能体 OCR 模式:两阶段处理兼顾文档检索效率与精度

    LlamaIndex 提出了面向 10 至 100 份文档临时数据室场景的即时智能体 OCR(Just-in-Time Agentic OCR)模式,通过两阶段处理降低 VLM 全量解析的高昂成本与延迟。

    推荐理由:文章拆解了即时智能体 OCR 的两阶段处理机制,为百篇内临时文档集的低成本精准解析提供了清晰的落地参考。

  12. Claude 官方博客(网页)80

    Anthropic 上线 Claude Marketplace 插件与智能体市场

    Anthropic 正式推出 Claude Marketplace,支持用户连接常用应用与数据、购买由合作伙伴构建的 Claude 软件以及接入认证服务伙伴。市场目前提供超过 2,000 个连接器与插件,涵盖 Google Workspace、Microsoft 365、Notion、Figma、Slack 以及 Atlassian MCP 等工具。

    推荐理由:原文给出了连接器、合作伙伴工具与咨询网络的具体分类与接入方式,读者可以据此评估 Claude 融入企业工作流的最新生态能力。

  13. Claude 官方博客(网页)73

    Anthropic 推出生命科学 AI 方案与 Claude Science 公测版

    Anthropic 宣布推出面向生命科学领域的 AI 方案,并开启科学家 AI 工作台 Claude Science 的公开测试。该平台可连接 PubMed、bioRxiv 等科研数据库与分析工具,支持生物信息学数据处理、文献综述、临床试验方案拟定与 FDA 监管文档起草,同时结合 Claude Code 重构遗留科学代码。

    推荐理由:原文展示了面向生命科学的完整工具链与落地用例,读者可了解大模型在生物医药研发和合规文档流程中的实际落地方式。

  14. Claude 官方博客(网页)49

    Claude 医疗健康领域应用与解决方案

    Claude 面向医疗健康领域提供智能化工作流支持,覆盖预授权审核、保险理赔申诉、患者消息分流以及环境临床病历记录等场景。系统支持通过 MCP 连接 NPI 注册表与 ICD-10 数据库核验医保合规标准,并在演示中仅用 47 秒即可从 12 分钟就诊录音中生成完整病历并标注用药警示。

  15. Claude 官方博客(网页)59

    Anthropic 推出金融服务行业解决方案与 Claude 顾问工作流

    Anthropic 正式推出面向金融服务领域的行业解决方案及专为投资顾问设计的 Claude 工具包,覆盖银行业、财富管理、保险和资产管理等核心场景。该方案提供预构建的金融智能体模板与工作流插件,支持在 Excel 和 PowerPoint 中直接运行模型分析、生成报告与审计追踪。

  16. Claude 官方博客(网页)78

    Anthropic 发布 Claude 网络安全解决方案与 Mythos 系列模型

    Anthropic 推出 Claude 网络安全解决方案,并披露具备高阶漏洞利用推理能力的 Claude Mythos 5 与通用安全版 Claude Fable 5。

    推荐理由:原文披露了模型在全系统控制与漏洞挖掘上的能力跃迁及防护闭环,读者可据此评估前沿模型在自动化漏洞修补中的实际落地深度。

  17. Cloudflare Blog · 网络基础设施69

    Cloudflare 发布开源内容管理系统 EmDash 1.0 并上线去中心化插件注册表

    Cloudflare 正式发布基于 Astro 架构的开源内容管理系统 EmDash 1.0,并推出基于 AT Protocol 的去中心化插件注册表。系统内置 MCP 服务器支持 AI 智能体直接调用管理,插件通过 Dynamic Worker 或 workerd 独立沙盒运行并限制权限,同时开源了 AI 建站工具 EmDash Build Alpha 版本。

    推荐理由:EmDash 结合了 Astro 框架与沙盒化插件隔离机制,为开发者和 AI 智能体协作构建与管理网站提供了可参考的架构实践。

  18. Cloudflare Blog · 网络基础设施72

    Cloudflare 发布 Kitesurf 浏览器更新:支持 WebMCP 与终端渲染

    Cloudflare 宣布为其运行在 Workers 上的智能体专用浏览器 Kitesurf 推出重大更新,新增了对 WebMCP 协议的全面支持,使 AI 智能体可直接调用网页暴露的工具函数。

    推荐理由:原文展示了边缘无头浏览器专为智能体优化延迟与协议接入的演进路径,有助于开发者评估轻量化网页自动化方案。

  19. Hacker News · AI76

    开源项目 data-agent-rules 发布:防止 AI 智能体破坏数仓的规则集与 MCP 工具

    开发者发布开源项目 data-agent-rules,通过 8 条操作规则、5 项专属技能以及 safe_peek 脱敏预览和 cost_check 成本预估工具,防止 Claude Code、Cursor、Copilot 等 AI 智能体在数仓中误删、篡改数据或触发高额扫描账单。

    推荐理由:项目通过规则约束与 MCP 工具规范 AI 编写 SQL,并在本地评测中给出了规避数据误删和高额查询账单的落地解法。

  20. Google Developers · AI 筛选73

    Google 总结 AI 智能体挑战赛优秀作品的 4 个核心工程模式

    Google for Startups 在 AI 智能体挑战赛收官后,总结了表现优异的多智能体方案所采用的 4 项关键工程架构模式。核心模式包括通过双向 MCP 将自身推理能力暴露为供其他智能体调用的服务、采用异步事件总线避免串行调用链累积延迟、对主备降级模型强制执行统一逻辑校验,以及利用低成本判定与正则分流降低推理开销。

    推荐理由:归纳了多智能体工程中双向 MCP 与事件驱动等架构细节,为开发者优化延迟与推理成本提供了可直接复用的方案。

  21. Cerebras 官方博客(网页)66

    Cerebras 详解用自然语言 AI 智能体自动化测试云控制台的实践

    Cerebras 详细介绍了其内部构建的端到端测试框架 console-prompt-tests,使用纯自然语言描述测试用例,并由大语言模型智能体通过 Playwright MCP 协议驱动真实浏览器完成交互与校验。

    推荐理由:原文详细拆解了用自然语言智能体驱动浏览器测试与自动修复前端漂移的架构,为研发团队重构端到端测试流程提供了可落地的参考。

  22. Claude 官方博客(网页)85

    Anthropic 推出 Claude Platform 智能体开发平台

    Anthropic 推出 Claude Platform 开发者平台,整合前沿模型、智能体运行框架与上下文管理等全套基础设施。平台提供 Fable 5.1、Opus 5.5、Sonnet 5.5 和 Haiku 4.5 模型矩阵,支持最高 100 万 token 上下文、代码执行、计算机操作(Computer use)及 MCP 协议。

    推荐理由:原文汇总了最新模型矩阵定价与智能体开发套件,便于开发者评估多步骤任务与企业级工作流的迁移成本。

  23. Claude 官方博客(网页)77

    Claude 推出插件市场 Marketplace 提供 340 款一键安装工具与 MCP 集成

    Claude 推出插件市场(Claude Marketplace),聚合了 340 款整合工具、技能与集成的插件并支持一键安装。市场覆盖了 GitHub、Microsoft Playwright、Vercel、Supabase、Figma 等官方 MCP 服务与开发套件,支持在 Claude Code 中完成代码审查、浏览器自动化测试、云端部署与设计稿转代码等任务。

    推荐理由:原文给出了插件市场的具体分类与集成工具清单,读者可以据此评估将外部开发工具接入工作流的可行性。

  24. Claude 官方博客(网页)64

    Claude Marketplace 聚合 867 个连接器与 MCP 插件

    Claude Marketplace 汇集了 867 个连接器与插件,支持将外部工具直接接入 Claude 对话。平台支持前端代码生成、子智能体开发与代码审查、Upstash Context7 实时文档检索、微软 Playwright 浏览器自动化端到端测试以及 monday.com 项目管理等功能。

    推荐理由:原文给出了连接器生态与典型 MCP 服务能力,读者可以据此了解工具集成支持的开发和自动化场景。

  25. Claude 官方博客(网页)80

    Claude 推出科学研究工作台应用 Claude Science

    Anthropic 推出面向科研人员的 AI 工作台应用 Claude Science 并开启公测,支持在本地、集群或 GPU 上运行数据分析与作业调度。该应用可原生查看蛋白质与分子结构,直连 60 余个科学数据库及 NVIDIA BioNeMo 工具链,并支持通过 MCP 连接外部工具。每次分析生成的图表与结论都会绑定完整代码、运行环境与对话记录,以便后续复现与核验。

    推荐理由:原文详细展示了面向生命科学的数据分析、算力编排与可追溯工作流,读者可据此评估其对科研实验及生信管线的适配度。

  26. Claude 官方博客(网页)83

    Anthropic 推出终端代码智能体 Claude Code

    Anthropic 推出代码智能体工具 Claude Code,支持在终端、IDE、Slack 或网页端协同工作,能够自主处理 Bug 修复、跨文件重构与长期代码迁移等研发任务。

    推荐理由:官方全面介绍了这款代码智能体的终端定位与长流程处理能力,方便开发者评估其接入现有开发栈的实际价值。

  27. Claude 官方博客(网页)69

    Claude 升级产品功能体系并整合 Cowork 功能

    Anthropic 升级 Claude 产品定位与功能体系,将其从对话问答扩展为可接管长任务与多应用工作流的协作智能体,并将 Claude Cowork 与 Chat 整合为统一体验。

    推荐理由:官方整合了对话与工作流执行能力,展示了从单轮问答向多工具协同和长任务接管的具体落地形态。

  28. Google Developers · AI 筛选74

    Google Cloud API Gateway 支持将 REST API 直接转换为 MCP 工具

    Google Cloud API Gateway 推出公开预览版功能,支持直接充当远程 MCP 服务器,无需单独搭建与维护服务器即可将现有 REST API 转换为智能体可调用的 MCP 工具。

    推荐理由:原文给出了通过注解规范将现有网关直转为协议端点的具体配置与限制,有助于降低企业工具接入智能体的运维成本。

  29. AITNT · AI头条(网页)24

    AI产品热榜

    AI产品热度榜单平台已收录 28638 款产品,并公布了最新热度排行。在总榜中,Quizzio 以 23454 热度位列第一,Wispr Flow(11117)、BuyScout™(11097)、Blaze Designer(10110)与 BeforeSunset AI 2.0(9969)分列二至五位。

  30. Hacker News · AI48

    Diffsmith:面向 AI 编程智能体的 macOS 代码审查工具

    Diffsmith 推出面向 macOS 的本地 Git 代码审查工具,支持开发者对 AI 智能体生成的代码进行精准行内批注。用户可一键将批注转化为带代码上下文的提示词,或开启内置的本地 MCP 服务器供 AI 智能体直接读取与回复。该软件完全在本地沙盒运行且无数据收集,采用一次性买断制售价 $5.99。