arXiv 自然语言处理· Shuai Guo, Yidong Cui·· 3 小时前AI 评分43
BeliefScope:诊断大语言模型中证据驱动的修正与压力导致的偏转
BeliefScope: Diagnosing Evidence-Driven Revision and Pressure-Induced Shifts in Large Language Models
AI 导读
研究人员提出受控黑盒框架 BeliefScope,用于区分大语言模型因真实证据驱动的修正与因用户引导性压力产生的偏转。该框架交叉证据与压力变量,通过概率报告、分类判断和行动建议等多通道测量响应变化。在覆盖 36 个 Qwen 和 Llama 家族模型及 Gemma3-12B 的测试中,其生成了包含明确有效性边界的条件信念响应画像。
来源:arXiv 自然语言处理 · arxiv.org