跳到正文
原文
arXiv 自然语言处理· Zizhuo Zhang, Xiong Peng, Jingwei Sun, Rong Yao, Borui Jiang, Bo Han·· 5 小时前AI 评分45

从成对上下文敏感视角重新审视大语言模型的忠实度

Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective

AI 导读

研究提出成对忠实度评测基准 PFaithBench,用于评估大语言模型在支持性与非支持性上下文中能否在作答与拒答之间灵活切换。对 7 个模型家族的 39 个模型评测显示,多数模型存在强烈的作答倾向,多数忠实度错误源于上下文不足时的过度作答。研究进一步揭示了训练数据配比对模型行为的影响,相关代码和数据已开源。

来源:arXiv 自然语言处理 · arxiv.org