arXiv 自然语言处理· Pranav Darshan, Pranav A, Sravan Karthick T, Minal Moharir, Ivan P. Yamshchikov·· 1 天前AI 评分34
可检测性差距:大语言模型幻觉检测中隐藏的异质性
The Detectability Gap: Hidden Heterogeneity in Hallucination Detection Across Language Models
AI 导读
研究发现基于采样一致性的模型幻觉检测存在显著的可检测性差距,高一致性(Ghost)与低一致性(Flickering)幻觉之间的 AUC 差距达 0.35 至 0.46。在 4 个语言模型和 3 个事实问答数据集的全部 12 种配置中,词汇与语义响应离散度均证实了这种不对称性。难以检测的高一致性状态在各模型中占比达 16% 至 77%,表明聚合指标掩盖了幻觉的异质性。
来源:arXiv 自然语言处理 · arxiv.org