arXiv 人工智能· Haorui Ma, Zehua Zang, Jiangmeng Li, Yi Li, Fanjing Xu, Stefan Feuerriegel·· 2 天前AI 评分34
基于正交均衡学习的上下文相关智能体评估
Context-dependent agent evaluation with orthogonal equilibrium learning
AI 导读
针对离线反馈中异质人类偏好导致的传递性假设失效与数据偏差问题,研究提出了鲁棒上下文均衡学习框架 NashEval。该框架先构建博弈收益矩阵的去偏估计,再利用定制的正交损失直接学习上下文到纳什均衡的映射,避免为每个上下文单独求解博弈。实验表明,NashEval 提升了均衡学习的鲁棒性,能在不同上下文中稳定识别出最优 AI 智能体集合。
来源:arXiv 人工智能 · arxiv.org