跳到正文
原文
arXiv 自然语言处理· Rafal Kocielnik, Peiyang Song, Pengrui Han, Myrl G. Marmarelis, Ramit Debnath, Dean Mobbs, R. Michael Alvarez·· 6 小时前AI 评分41

LLM 冒险决策中自我报告与行为一致性的表征控制研究

Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking

AI 导读

一项研究通过激活引导干预 4 款开源大语言模型,发现模型在冒险决策中的自我报告与实际行为由近乎正交的内部表征方向独立控制。基于 9 种引导向量提取方法的测试显示,特质描述仅改变自我报告,任务选择仅改变行为,去除混淆后指令仅保留 32% 的行为效应。反转组合干预更使 69-89% 的测试中报告与行为截然相反,表明评估需结合内部表征检查。

来源:arXiv 自然语言处理 · arxiv.org