arXiv 人工智能· Hoda Ayad, Tanu Mitra, Abhishek Mukherji·· 4 小时前AI 评分43
CuBEs:文化情境化行为评估与忽视文化的 LLM 裁判局限性
CuBEs: Culturally-Situated Behavioral Evaluations and the Limitations of Culture-Blind LLM Judges
AI 导读
研究人员提出 CuBEs 框架,用于在多元文化背景下评估大语言模型(LLM)的阿谀奉承与过度自信等行为特征及部署风险。研究构建了涵盖 12 种不同文化的人工标注数据集,并对 13 个开源及闭源 LLM 展开评估。实验表明,忽视文化的传统评测无法捕捉非西方背景下的宗教或殖民等政治偏见维度,凸显了全球化部署中文化情境测试的必要性。
来源:arXiv 人工智能 · arxiv.org