arXiv 自然语言处理· Michael Rathmayr, \'Ad\'am Kov\'acs, G\'abor Recski·· 6 小时前AI 评分44
Grounding Probes:基于观察者模型隐藏状态且独立于生成器的模型幻觉检测
Grounding Probes: Generator-Independent Hallucination Detection from Observer Model Hidden States
AI 导读
研究提出 Grounding Probes 方法,通过单次前向传播读取独立观察者大语言模型的中间层隐藏状态,实现与生成模型解耦的模型幻觉检测。该探针在 15,090 条标注回复上拟合,在 RAGTruth 测试集跨 4 个观察者模型取得 0.879-0.894 AUROC,与监督跨度检测器结合后可达 0.924 AUROC。单一探针可通用于 6 个生成器,相关代码已开源。
来源:arXiv 自然语言处理 · arxiv.org