港科大推出LexAgentHallu基准:揭示法律智能体高发「隐性幻觉」
香港科技大学提出面向法律智能体的幻觉评测基准LexAgentHallu。该基准通过沿着智能体的执行轨迹逐阶段定位错误,研究发现:即便智能体给出的最终答案正确,仍有高达68%的执行轨迹存在法律内容层面的幻觉;而在当前表现最佳的配置下,也有89%的轨迹出现过幻觉,揭示了智能体在复杂推理过程中“答对但理由错”的隐性可靠性隐患。
推荐理由针对法律智能体执行轨迹中的隐性幻觉提出评测基准,揭示了'结果正确但过程错误'的普遍问题,对高可靠垂直领域智能体落地有参考价值。
原标题:答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」
阅读 AITNT · AI头条(网页) 原文 ↗