arXiv 自然语言处理· Mengze Hong, Zeyang Lei, Wenbo Shang, Xia Zeng, Xiying Zhao, Qi Zhu, Chen Jason Zhang, Di Jiang, Taiming Fu, Qiongyi Zhou, Qinghe Chang, Fubao Zhang, Chenxuan Ma, Minlong Peng, Jinfeng Huang, Zineng Zhou, Jindou Wu, Muge Qi, Sijun He, Xin Cui, Di Liang, Yuan Hua, Davey Chen·· 4 小时前AI 评分37
UXBench Pro:多轮对话交互中个性化用户体验评测基准
UXBench Pro: Benchmarking Personalized User Experience in Multi-Turn Dialogue Interactions
AI 导读
UXBench Pro 包含来自 12 个任务场景和 82 个领域的 1,000 个真实交互测试实例,通过 FACTORS 画像的 7 个行为维度刻画不同用户。该基准提出结合个性化用户奖励模型 URM 与用户模拟器 Sim4Eval 的双视角评估范式,并配套 URMBench 和 USimBench 两个元基准,以检验其复现真实人类偏好与行为的可靠性。
来源:arXiv 自然语言处理 · arxiv.org