AIDC
DC AI 热点

全部 AI 动态

9月28日2026-09-28
arXiv 人工智能AI 评分 60/10012:00

将 AI 引入自主系统:从认知到群体智能的设计框架

该论文探讨了自主系统作为 AI 发展核心阶段的定位,重点分析了融合联结主义 AI 与符号主义 AI、以及打通 AI 与系统工程的技术挑战。作者提出了一个用于设计与评估自主系统的通用智能体架构框架,将智能体行为定义为围绕长期记忆和演进知识构建的多项认知功能组合,为复杂自主系统与群体智能的工程化落地提供了方法论参考。

阅读原文 ↗推荐理由:提出融合神经与符号 AI 的自主智能体系统工程设计框架,具有一定的理论参考价值,但缺乏具体工程实测突破。# 智能体# 具身智能# 记忆# 前沿研究
arXiv 自然语言处理AI 评分 68/10012:00

并非所有记忆都等价:面向大模型智能体的分层协作记忆检索机制

在多智能体团队协作场景中,记忆具有异质性且持续动态演进。现有记忆增强系统通常将记忆扁平化存储,仅根据语义相似度或时间排序,导致检索到语义相关但已失效或冲突的过时信息。该论文提出一种分层协作记忆架构,区分团队集体共识与个体执行轨迹,建模记忆的层级结构与时效有效性,从而提升多智能体协作中的检索准确性与决策一致性。

阅读原文 ↗推荐理由:针对多智能体协作中记忆扁平化与时效冲突的痛点提出了分层检索机制,对Agent系统架构设计有参考价值。另有 1 家信源报道# 智能体# 记忆# 大模型# 自然语言处理
arXiv 人工智能AI 评分 65/10012:00

基于 MCP 协议桥接大模型智能体与数据空间的架构中介方案

数据空间(Data Spaces)支持跨组织边界的自主和受控数据共享,但概率型大语言模型交互与策略驱动型数据基础设施之间存在明显错配。该研究提出了一种基于模型上下文协议(MCP)的架构中介方法,并通过 Eunomia Agent 进行实现。该中介层将数据空间的服务与能力转化为结构化、模式驱动的工具接口,从而实现 LLM 智能体与数据空间服务之间安全、可控的交互。

阅读原文 ↗推荐理由:探讨了当前热门的 MCP 协议在受控企业数据空间集成中的具体落地架构,具有不错的工程参考价值。# 智能体# MCP# 大模型
arXiv 人工智能AI 评分 72/10012:00

隐蔽分散但协同危害:针对技能型智能体系统的级联攻击研究

基于技能(Skill)的智能体系统允许在运行时加载第三方模块化能力,但其开放生态也带来了新型安全风险。以往研究多聚焦于单一技能本身的漏洞,忽视了跨技能交互带来的威胁。该论文提出“技能级联攻击”这一全新威胁范式,揭示了攻击者如何利用看似独立隐蔽、各自无害的恶意技能,在智能体组合调用时引发连锁危害,拓展了多技能智能体生态的安全研究边界。

阅读原文 ↗推荐理由:针对智能体技能生态系统提出了新颖的跨技能级联攻击范式,对 Agent 安全防护设计具有重要参考价值。# 智能体# 安全# 对齐
arXiv 人工智能AI 评分 75/10012:00

大模型智能体执行失控现象研究:解析“过度行动”与全局控制架构

该论文提出了“LLM帕金森综合征”(LLM Parkinsonism)这一比喻,用以描述自主智能体在达成初始目标后仍持续无效行动、反复验证或修复自造复杂性,导致Token效率低下的执行控制失效现象。研究指出该问题源于全局执行控制与不确定性评估机制的缺失,而非单纯自回归预测机制所致,并据此设计了一种具备不确定性感知能力的全局执行控制架构,以改善长程任务下的智能体决策收敛。

阅读原文 ↗推荐理由:精准指出了智能体长程任务中“停不下来”且浪费算力的核心痛点,并给出了控制架构层面的解法。# 智能体# 大模型# 推理# 前沿研究
arXiv 人工智能AI 评分 62/10012:00

CRC-Router:面向医疗智能体系统的风险约束路由机制

在医学影像等医疗场景中,智能体(Agentic AI)系统的自主错误容易向临床决策下游传播,阻碍实际部署。为此,研究人员提出 CRC-Router,一种兼顾风险约束与不确定性感知的新型路由模块。该机制通过可靠的不确定性评估,动态决策何时由智能体自主执行任务,何时将病例上报给人类医生进行复审,从而在提升医疗通量与降低临床风险之间实现平衡。

阅读原文 ↗推荐理由:针对医疗高风险场景下智能体缺乏可靠容错机制的痛点,提出了务实的人机协同分流方案,对医疗AI落地工程有参考价值。# 智能体# 医疗AI# 安全
arXiv 人工智能AI 评分 72/10012:00

针对编程智能体低效成本行为的分析与优化策略研究

编程智能体在执行任务时往往消耗大量 Token 带来高昂成本。该研究针对 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 上的 1200 条运行轨迹进行分析,识别出包容性重复检索、相似脚本重复生成及测试重复执行三大成本低效行为。研究进一步提出了结构感知检索、智能体自合成技能与开发者设计技能三种缓解策略,并在超 1 万条轨迹中验证了其降本效果。

阅读原文 ↗推荐理由:直击 Coding Agent 在实际应用中推理成本高昂的工程痛点,归纳的低效模式与优化策略对智能体系统开发具实用参考价值。另有 1 家信源报道# 智能体# AI编程# 评测# 大模型
arXiv 人工智能AI 评分 68/10012:00

高效多智能体工作流新方法LW2S:通过反事实信用分配学会“跳过冗余步骤”

针对多智能体大模型工作流中盲目执行规划、验证等所有组件导致算力浪费甚至覆盖正确中间结果的痛点,该研究提出了“学会跳过”(LW2S)框架。论文将组件省略形式化为反事实信用分配问题:利用全流程日志获取轨迹奖励,并结合受控的跳过干预评估省略后续步骤的后果,进而训练特定动作的安全模型。该方法使智能体能够动态判断并跳过非必要环节,在保证任务准确率的同时显著提升执行效率。

阅读原文 ↗推荐理由:针对多智能体流水线冗余计算和误修改痛点,提出了基于反事实干预的动态跳步方案,对智能体工程落地有实用参考价值。# 智能体# 大模型# 推理# 强化学习
arXiv 人工智能AI 评分 68/10012:00

多智能体共享记忆准入基准与诊断研究

针对多智能体系统中将重复主张误认为独立证据、导致错误信念在共享记忆库中扩散和放大的问题,研究团队提出了“相关晋升基准”(Correlated Promotion Benchmark, CPB)。该基准旨在评估系统是否应将候选主张接纳至共享记忆中。CPB 包含基于公开标注构建的静态评测集 CPB-Static,以及跟踪多智能体团队实时读写与信息源的动态评测环境 CPB-Live,为多智能体协作中的记忆安全与知识管理提供了标准化评估工具。

阅读原文 ↗推荐理由:针对多智能体共享记忆中容易出现的信息回音室与错误传播问题,提出了实用的准入评测基准。# 智能体# 记忆# 评测
9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

预测智能体何时应当推理?基于行为压力测试的可靠性路由研究

该研究探讨了预测智能体在结合大模型推理、信息检索、集成与校准时,各决策行为在何时具备可靠性。研究人员在ForecastBench风格的二元预测任务上,将智能体选择检索、推理、参考市场先验或采用历史类比等策略视为可观测行为并展开压力测试。核心结论显示,机制的最优选择高度依赖于数据生成源,结构化类比在特定数据流程中占据主导,而市场群体策略与保守基线在其他情境下表现更优。

阅读原文 ↗推荐理由:系统化探索了预测智能体在多策略切换下的行为可靠性,为智能体决策路由工程提供了实用参考。# 预测智能体# 智能体# 推理# 压力测试# 可靠性
arXiv 人工智能✦ 精选AI 评分 72/10012:00

PAWS:面向政策驱动的多智能体金融世界模拟数据集发布

针对现有金融多智能体模拟数据集缺乏与历史证据时间对齐的问题,研究人员推出了 PAWS(政策驱动型智能体世界模拟)数据集。该数据集涵盖 36 个经过验证的美国金融与经济政策事件、12,727 条与政策关联的新闻记录,以及 65,291 个基于实际来源的利益相关者行为。每个行为均关联支撑新闻,并通过多层事件框架表征交互模式与金融行动类别,为金融多智能体仿真与宏观政策影响模拟提供了扎实的数据基础。

阅读原文 ↗推荐理由:提出首个系统性关联政策与历史证据的金融多智能体模拟数据集,对复杂经济系统仿真具有重要参考价值。# 智能体# 金融模拟# 世界模型# 数据集
arXiv 人工智能✦ 精选AI 评分 73/10012:00

面向DNA测序数据分析自动化的智能体框架BaseCamp

针对DNA测序流程中质控阈值选择、边界变异判定、异常诊断及复核标记等高度依赖人工经验且标准不一的问题,研究团队提出了智能体AI框架BaseCamp。尽管现有工作流系统已能规模化调度生物信息学工具,但周边决策层仍需大量繁琐的手动判断。该框架旨在利用智能体自动化这一决策层,以提升测序数据分析流程的规范性与效率。(注:输入摘要在文末截断)

阅读原文 ↗推荐理由:将智能体技术应用于基因测序全流程决策,解决了生物信息管线中人工判定标准不一的痛点。# 智能体# 生物信息学# DNA测序# 工作流# 应用工程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

AdvRole:面向角色扮演智能体的对抗性闭环课程学习框架

基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。

阅读原文 ↗推荐理由:针对角色扮演智能体强化学习中训练场景固定的分布瓶颈,创新提出了对抗式闭环课程演化方案。# 角色扮演智能体# 强化学习# 大模型# 对抗训练# 课程学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TRACER:基于行为一致性对齐的多轮用户模拟器

针对交互式AI构建与评测中模拟用户难以复现真实意图演变和交互结果的缺陷,研究人员提出了多轮用户模拟器 TRACER。该模型能够显式建模用户动态演变的意图,使模拟行为与真实交互轨迹保持一致。TRACER 采用两阶段训练策略:首先在真实用户对话上进行监督微调(SFT),随后利用融合了分层结果与轨迹奖励的多轮强化学习进行对齐训练,从而大幅提升用户模拟的真实度与行为一致性。

阅读原文 ↗推荐理由:针对交互式AI系统评测中用户模拟器缺乏多轮行为一致性的痛点,提出了结合强化学习轨迹对齐的新型模拟器方案。# 用户模拟器# 交互式AI# 强化学习# 对齐# 智能体
arXiv 人工智能✦ 精选AI 评分 70/10012:00

Epydemix Agent:基于AI智能体驱动的流行病学建模框架

针对大语言模型智能体在调用科学软件时可靠性不足的问题,研究人员推出了 Epydemix Agent 框架。该框架建立在开源随机区室流行病学建模 Python 库 Epydemix 之上,为 AI 智能体提供四大核心能力:模型与参数发现、声明式场景规范的预防性验证、通过经过测试的库代码进行执行,以及结果的可检查性,从而实现了高可靠性的自然语言驱动科学建模。

阅读原文 ↗推荐理由:展示了大模型智能体与专业科学仿真工具结合的工程实践,重点探索了 AI 调用科学计算代码的可靠性与验证机制。# 智能体# 科学计算# 流行病学# 应用工程# 开源
arXiv 人工智能✦ 精选AI 评分 75/10012:00

skilder:基于角色权限控制的LLM智能体渐进式技能发现治理框架

针对大语言模型智能体在接入海量企业工具时面临的上下文超限、工具选择退化及合规治理漏洞等问题,研究人员提出了名为 skilder 的新框架。传统通过提示词设定的安全策略缺乏硬性约束,而多智能体委托方案又分散了审计日志。skilder 将技能与工具等能力打包为特定角色,通过基于角色的范围划分与渐进式技能发现机制,实现对智能体工具调用的结构化治理与确定性访问控制。

阅读原文 ↗推荐理由:针对企业级大模型智能体调用海量工具时的治理与性能痛点,提出了结构化的访问控制框架。# 智能体# 工具调用# 访问控制# 治理# 应用工程
arXiv 人工智能✦ 精选AI 评分 74/10012:00

META:结合情景记忆检索的多智能体金融决策框架

针对现有大语言模型交易系统多侧重长期预测或缺乏状态记忆等缺陷,研究人员提出了记忆增强型交易智能体框架 META。该框架是首个引入类似检索增强生成(RAG)的情景记忆增强型多智能体金融决策系统,通过整合一系列专门的指标分析智能体,有效解决了复杂交易环境下的动态决策需求,提升了智能体在金融分析与交易推理中的实际应用能力。

阅读原文 ↗推荐理由:提出首个引入情景记忆增强机制的多智能体金融决策框架,具有明确的行业应用落地价值。# 智能体# 金融科技# 记忆# RAG
arXiv 人工智能✦ 精选AI 评分 75/10012:00

RECLAIM基准:评估AI智能体复现机器学习论文研究结果的能力

该研究提出了名为RECLAIM的新基准测试,旨在评估AI智能体能否复现机器学习论文的核心研究结论。基准选取了100篇NeurIPS 2025论文,预先设定了待复现结果、成功复现判定标准以及GPU运行时间预算。根据原作者开源内容的完整度,基准设立了不同难度层级,测试智能体在软件安装、代码调试及运行实验等完整科研工作流中的自动化复现能力。

阅读原文 ↗推荐理由:提出针对AI智能体科研复现能力的标准化评测基准,对自动化科研与Agent工程落地具有较高参考价值。# 智能体# 评测# 自动化科研# 可复现性# 机器学习
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Forecast-Dojo:用于大模型预测智能体评测与训练的可回放环境

研究人员推出了名为Forecast-Dojo的可回放环境,专门用于基准测试和训练大语言模型预测智能体。该环境将已公布结果的预测市场问题与带时间戳的历史新闻相结合,允许智能体在连续的历史时间节点检索事件并动态调整预测,无需等待未来事件即可完成评估、交互数据收集与结果反馈。系统包含1568个Polymarket事件及1880万篇带日期的新闻文章,并对12个模型进行了评估测试。

阅读原文 ↗推荐理由:通过融合历史新闻与预测市场真实结果构建可回放环境,有效解决了大模型预测智能体评估周期长和训练反馈滞后的难题。# 智能体# 大模型# 评测# 事件预测# Polymarket
arXiv 人工智能✦ 精选AI 评分 75/10012:00

掌控智能体框架以控制成本:企业级AI编程智能体的路由与治理

随着企业内AI编程智能体从数百人试点规模扩展至数万人,企业多直接采购Claude Code或Codex等第三方运行框架。此类框架负责决策模型路由、上下文读取、Prompt缓存使用及子智能体调用,直接决定了算力消费单价与调用总量。报告指出,企业若直接使用未加调优的专有或默认框架,将面临高昂且失控的调用成本,亟需加强路由与治理管控。

阅读原文 ↗推荐理由:探讨了企业级AI编程智能体大规模落地中的核心痛点,分析了调度框架对模型路由与调用成本的关键影响。# 智能体# AI编程# 成本治理# 应用工程# 模型路由
arXiv 人工智能✦ 精选AI 评分 72/10012:00

动作归因何时需要更新?面向工具调用型智能体的高效更新机制研究

针对工具调用型智能体在策略持续更新中动作归因(Action Credit)失效、重新计算导致昂贵工具调用与环境交互成本的问题,该研究探讨了历史归因何时真正需要更新。研究核心发现,动作价值的变化并不一定会导致最终决策的改变;只要策略诱导的漂移不足以颠覆原有决策,历史动作归因即可继续复用,从而大幅降低计算开销。(注:原始摘要文本存在部分截断)

阅读原文 ↗推荐理由:聚焦工具调用智能体策略更新中的交互成本痛点,提出了通过判断决策漂移来复用历史归因的优化思路。# 智能体# 工具调用# 动作归因# 策略优化# 强化学习
arXiv 人工智能✦ 精选AI 评分 70/10012:00

AlphaDiverse:面向阿尔法因子多样性挖掘的本地量化研究智能体框架

基于大语言模型的多智能体系统虽能自动化挖掘量化阿尔法因子,但依赖外部API带来了成本、可用性及保密性挑战,且长期运行易导致研究路径坍塌。为此,研究团队提出 AlphaDiverse 框架,整合了多智能体研究系统、多样化研究路径收集以及本地智能体后训练流程。该框架通过生成互补的研究方案组合并动态调整研究环境,旨在提升本地量化研究智能体在因子挖掘中的多样性探索能力。

阅读原文 ↗推荐理由:聚焦量化金融中智能体私有化部署与多样化探索路径坍塌问题,提出了系统性的后训练与多智能体协作方案。# 智能体# 金融科技# 阿尔法因子# 后训练# 本地部署
arXiv 人工智能✦ 精选AI 评分 75/10012:00

MeshHeal:面向去中心化LLM多智能体网络灰度失效的双时间尺度自愈框架

在去中心化的大语言模型多智能体系统中,单个智能体可能在保持响应的同时任务求解质量持续退化,引发灰度失效。针对此类问题,研究人员提出了完全去中心化的自愈框架MeshHeal。该框架在双时间尺度上结合能力匹配的同行评审机制:在快速时间尺度上,通过自适应分层机制升级不确定或低评分输出的评审层级;在提供即时任务保护的同时,收集证据以动态调整未来的路由决策,并允许恢复正常的智能体重新接入。

阅读原文 ↗推荐理由:针对多智能体网络中隐蔽的质量退化难题,提出了去中心化的双时间尺度自愈与容错机制。# 智能体# 大模型# 自愈框架# 去中心化网络# 容错机制
arXiv 人工智能✦ 精选AI 评分 70/10012:00

CRISS:基于检索增强生成的癌症登记智能辅助问答系统

针对癌症登记员及肿瘤数据专家需处理复杂且频繁更新的编码和分期标准这一痛点,研究团队开发了CRISS(癌症登记智能支持系统)。该系统采用检索增强生成(RAG)架构,构建能够快速提供引文支持的对话助手。研究评估了CRISS在提供准确且附带引用来源的解答、改善指南检索与解读、以及在保持人工最终审核的前提下支持人员培训和技术咨询等方面的实际效果。

阅读原文 ↗推荐理由:展示了RAG技术在高度专业化的医疗癌症登记垂直领域的实际落地与辅助应用。# RAG# 智能体# 医疗AI# 自然语言处理# 应用工程
arXiv 人工智能✦ 精选AI 评分 60/10012:00

欧洲电力交易市场的AI系统功能架构:监管约束下的交易设计规范

该研究针对欧洲电力交易跨日前、日内和平衡等多层级市场的复杂机制,提出了一种符合监管约束的AI辅助交易系统功能架构。该架构深度结合了欧盟市场耦合机制、跨区域电力传输物理约束,并满足REMIT、MiFID II、MiFIR和EMIR等合规要求。研究通过定义决策状态向量、残差风险敞口核算以及约束优化目标,构建了一套正规化的系统规范,为高监管环境下的电力AI交易系统开发提供了工程指导。

阅读原文 ↗推荐理由:系统性阐述了强监管与物理约束下欧洲电力交易AI系统的功能架构设计,对行业垂直AI应用落地具有参考价值。# 电力交易# AI交易系统# 系统架构# 欧洲能源市场# 治理
arXiv 人工智能✦ 精选AI 评分 72/10012:00

持久化前先划定范围:防止智能体记忆中的跨任务族干扰

该研究探讨了大语言模型智能体的持久记忆机制,旨在不更新权重的前提下持续改进提示与技能。研究发现,将检索范围与认证范围精确匹配,能有效防止跨任务族的干扰,支持在重复出现的任务族中实现可靠适应。研究人员在12轮代码修复数据流ProcStream-RSI上对冻结模型智能体进行了测试,并使用基于执行的正交回归控制门控机制,证实仅在技能生成的原始任务族内检索该技能,可显著提升轨迹效用。

阅读原文 ↗推荐理由:提出了一种通过范围约束解决智能体持久记忆跨任务干扰的方法,对智能体技能复用和持续适应具有参考价值。# 智能体# 记忆# 大模型# 技能检索# AI编程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于偏差引导的大模型智能体技能自我进化机制

该研究针对大语言模型智能体在复杂工具使用任务中的技能自我进化问题展开探索。论文指出,复杂任务通常存在多种有效解题路径,失败轨迹往往也包含前期的有效进展而非全盘皆错。因此,研究提出不应将失败轨迹强行与固定成功路径对齐或进行粗粒度反思,而应精确定位有效求解向错误偏离的转折点,通过偏差引导的方式实现智能体技能的高效自我进化与演进。

阅读原文 ↗推荐理由:提出了一种细粒度定位失败偏离点的智能体技能演进新思路,有助于提升复杂工具调用场景下的自适应能力。# 智能体# 大模型# 工具调用# 自我进化# 轨迹分析
LlamaIndex 官方博客(网页)✦ 精选AI 评分 68/100收录 07:49

基于AI智能体的文档处理:实现复杂工作流端到端自动化

本文介绍了基于智能体的文档处理(Agentic Document Processing)技术。该方案借助AI智能体自主执行端到端的文档业务流程,旨在解决传统自动化难以应对的复杂工作流挑战。内容重点阐述了该机制的核心运行原理,并为企业和开发者如何启动并落地此类智能体自动化应用提供了实践指导。

阅读原文 ↗推荐理由:聚焦AI智能体在文档处理这一高频企业场景中的端到端工程落地,具有较好的实用参考价值。另有 1 家信源报道# 智能体# 文档处理# 工作流# 应用工程
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 65/10012:00

Lean Pool:由AI智能体自主维护与优化的形式化数学代码库

Lean Pool 是一个形式化数学代码库,其核心特色在于完全由 AI 智能体负责拓展、维护与持续优化。该项目展示了人工智能在形式化定理证明与复杂数学知识归档中的自主管理潜力,有助于提高数学形式化库的组织效率与代码质量。由于原论文摘要提供的信息极为简略,具体的智能体协作机制与工程实现细节仍有待进一步公开。

阅读原文 ↗推荐理由:展示了利用 AI 智能体自主构建与维护形式化数学库的新探索路径。# 形式化数学# Lean# 智能体# 自动定理证明# 代码库维护
arXiv 人工智能✦ 精选AI 评分 70/10012:00

AI神经科学家:面向神经影像分析的交互式智能体界面

神经影像数据分析通常需要专业的编程与统计技能,这给非计算背景的研究人员带来了门槛。为此,研究团队推出了“AI神经科学家”,这是一种用于交互式数据探索的语言智能体。该系统将大语言模型与神经影像专业工具集相结合,支持研究人员直接通过自然语言查询数据质量、执行建模与可视化并设定分析参数,为小规模数据探索提供了一种替代传统脚本处理流程的透明且交互式的解决方案。

阅读原文 ↗推荐理由:将大语言模型智能体引入神经影像学领域,有效降低了专业科研数据分析的编程门槛。# 智能体# 神经影像# AI for Science# 大模型# 交互分析