AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 68/10009月28日 12:00

CARGO:面向生产环境智能体的上下文感知检索门控评测框架

针对生产环境中智能体在动态实体(如客服工单、账户等)操作时的评测难题,传统基于参考答案的 LLM-as-a-judge 方案常因参考案例与实际运行实体的标识、日期等不同而误判为幻觉或错误(即参考与实例分歧 RID)。为此,研究人员提出 CARGO 评测框架。该框架将检索到的历史参考样本视作“操作流程范例”,同时结合实时运行上下文进行事实性判定,从而显著提高了生产环境智能体评测的鲁棒性与准确率。

推荐理由针对生产环境智能体评测中“参考案例与动态上下文不一致导致误判”的实际工程痛点提出了解法,具备落地参考价值。

原标题:CARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production

阅读 arXiv 自然语言处理 原文 ↗

同一事件的其他来源

arXiv 自然语言处理09月28日 12:00

并非所有记忆都等价:面向大模型智能体的分层协作记忆检索机制

在多智能体团队协作场景中,记忆具有异质性且持续动态演进。现有记忆增强系统通常将记忆扁平化存储,仅根据语义相似度或时间排序,导致检索到语义相关但已失效或冲突的过时信息。该论文提出一种分层协作记忆架构,区分团队集体共识与个体执行轨迹,建模记忆的层级结构与时效有效性,从而提升多智能体协作中的检索准确性与决策一致性。

arXiv 人工智能09月28日 12:00

HasMem:面向长周期大模型智能体的自适应软化记忆架构

针对大模型在处理历史长上下文时的记忆复用与压缩难题,研究人员提出了HasMem(硬源自适应软化记忆)架构。该方法以冻结的硬提示嵌入作为可验证初始状态,通过控制器动态调整记忆宽度,利用Writer模块重编码条目,并配合Reader与全局模块实现读取适配和跨轮次状态传递。在多轮对话数据集MSC的重建探针测试中展现出良好的记忆性能。