跳到正文
原文
arXiv 人工智能· Xiaoyang Wang, Tianrui Wang, Christopher C. Yang·· 1 天前AI 评分42

ProbeGuard:通过医疗大语言模型共识形成机制实现可信弃权

Unanimously Wrong: Certified Abstention from How Medical LLM Consensus Forms

AI 导读

研究人员提出 ProbeGuard 框架,通过分析医疗大语言模型共识形成过程来识别“全票错误”并实现可信弃权。MedQA 评测显示 13.4% 的全票一致回答实际存在错误,该框架结合共识轨迹、理由语义熵与主动探针,将真伪共识区分度提升至 0.696 AUROC。其分层 Learn-then-Test 校准在全票层问题上实现了 9.0% 的实测选择性风险。

来源:arXiv 人工智能 · arxiv.org