arXiv 自然语言处理· Sihyeon Lee, Jihun Song, Chanwoo Kim, Jiwoo Kum, Chanjun Park·· 5 小时前AI 评分36
OMIT 基准:评估大语言模型在哲学分歧下的不作为偏差
OMIT the Action: Measuring Framing-Invariant Omission Bias under Philosophical Disagreement
AI 导读
研究人员提出评测基准 OMIT,包含 10 种冲突类型下的 218 对配对框架场景,用于评估大语言模型在哲学分歧下的不作为偏差。对 8 个 LLM 的评测显示,不作为偏差普遍存在,但在同系列模型中与模型规模呈负相关。测试 4 种推理期干预发现,引导模型在作是非判断前先考虑道德原则可减少该偏差并提升框架一致性。
来源:arXiv 自然语言处理 · arxiv.org