arXiv 人工智能· Jiameng Zhang, Hongqiu Wu·· 6 小时前AI 评分39
分工问答中推理依据传递了什么:一项消息干预研究
What Do Rationales Communicate? A Message-Intervention Study in Role-Specialized QA
AI 导读
在分工问答中,传递忠实的推理依据相比无依据几乎未提升答案准确率,但篡改依据会使验证器的支撑判断发生 10%–55% 的显著偏移。基于 400 个多跳问答样本及 DeepSeek 模型的测试显示,最终答案仅变动 2%–30%。人工审查进一步发现模型存在过度信任现象,其接受的篡改推理依据中有 9/10 被人类拒绝或标记为不明确。
来源:arXiv 人工智能 · arxiv.org