基于扰动强度增强大模型解释自洽性评估
该论文针对大语言模型生成解释的自洽性评估问题展开研究。以往基于表面扰动的评测方法未能明确度量和控制扰动强度。对此,研究团队提出了一种利用大模型作为裁判(LLM-as-a-judge)的统一扰动强度度量方法,覆盖输入扰动与思维链(CoT)扰动。通过在可控强度条件下对多种主流大模型生成的解释进行公平横向评测,实验验证了该方法在解释可信度和鲁棒性评估上的有效性。
推荐理由提出量化扰动强度来公平评估模型解释自洽性的新方法,对大模型可解释性与评测基准有参考价值,但属于较垂直的学术增量工作。
原标题:Enhancing Assessment of Self-Consistency in LLM Explanations using Perturbation Strength
阅读 arXiv 自然语言处理 原文 ↗