arXiv 人工智能· Jintao Huang, Yifan Wang, Hongyu Shen, Yi Daniel Lu, Shirley Huang, Minsik Oh, Yewen Wang, Muhammad Ahmed Mohsin, Zhen Xu, Yilan Fan, Zichen Yuan, Ahsan Bilal, Zibu Wei, Sankalp Jajee, Henry Gagnier, Saksham Kapoor, Jicheng Wang, Qianfeng Wen, Yixuan He, Steven Dillmann, Jiashu He, Yucheng Lu, Linqiang Guo, Danyang Zhang, Shi Bo, Raunak Mondal, Haixiang Tang, Weihang Xiao, Allen Nie, Jing Tang, Yueying Li, Yifan Simon Liu, Jianheng Hou, Dianzhuo Wang, Qianyu Zhu, Zhixu Silvia Tao, Zhejian Peng, Zihan Wang, Ishan Gupta, Jinxuan Fan, Wanting Jiang, Shushu Liang, Chenxi Qiu, Yijun Wang, Xiaomin Li, Yuexing Hao·· 4 小时前AI 评分41
AgentPersonaBench:人设驱动用户模拟评测基准
AgentPersonaBench: Benchmarking Persona-Driven User Simulation
AI 导读
研究团队推出 AgentPersonaBench(APB)评测基准,用于评估人设设定能否切实引导 AI 智能体的下游行为。该基准包含涵盖 867 种特质的 2,460 项任务,在问卷、对话、Web 和 App 4 种交互环境中通过可观测操作验证人设依从性。评测 20 款前沿模型显示,领先模型无提示依从率达 84.7%,但跨全部 4 种界面的通过率降至 37.9%–64.3%。
来源:arXiv 人工智能 · arxiv.org