CARGO:面向生产环境智能体的上下文感知检索门控评测框架
针对生产环境中智能体在动态实体(如客服工单、账户等)操作时的评测难题,传统基于参考答案的 LLM-as-a-judge 方案常因参考案例与实际运行实体的标识、日期等不同而误判为幻觉或错误(即参考与实例分歧 RID)。为此,研究人员提出 CARGO 评测框架。该框架将检索到的历史参考样本视作“操作流程范例”,同时结合实时运行上下文进行事实性判定,从而显著提高了生产环境智能体评测的鲁棒性与准确率。
推荐理由针对生产环境智能体评测中“参考案例与动态上下文不一致导致误判”的实际工程痛点提出了解法,具备落地参考价值。
原标题:CARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production
阅读 arXiv 自然语言处理 原文 ↗