Hacker News · AI· chrystianpl·· 2 小时前精选AI 评分70
12款大模型道德决策实测:为何认知明确反对仍会执行不公判决
AI praises Gandhi. Would it arrest him?
AI 导读
一项针对12款大语言模型在15个历史决策案例及现实情境下的实测发现,多数模型在旁观者角色下能明确谴责不公正判决,但在代入法官等执法角色时却频繁选择执行该判决。测试表明,高阶模型在部分案例中能利用自由裁量权免除不当惩罚,而提示词中是否包含后来的平反裁决显著影响了模型的执行倾向。
推荐理由
研究通过图灵案等历史案例对比模型在旁观与执行角色下的行为差异,揭示了道德认知与角色遵从之间的脱节现象。
来源:Hacker News · AI · chrystianschutz.com