跳到正文
原文
arXiv 自然语言处理· Yihuai Hong, Shauli Ravfogel, Chen Zhao, Eunsol Choi·· 1 天前AI 评分44

让大语言模型说出真实想法:衡量与提升思维链(CoT)的可解释性对齐

Making LLMs Say What They Think: Measuring and Improving CoT-Interpretability Alignment

AI 导读

研究人员提出 CIA(CoT-Interpretability Alignment)指标,用于衡量大语言模型的思维链(CoT)与其内部实际推理策略的一致性。在 3 个大语言模型及两跳问答、提示干预、整数乘法任务上的测试表明,当前模型的 CoT 对齐度仅为 44.8-75.9%。团队通过将准确率与参数忠实度作为后训练奖励,在保持准确率的同时大幅提升了 CoT 忠实度,相关代码与数据已开源。

来源:arXiv 自然语言处理 · arxiv.org