arXiv 人工智能· Xiaoyang Wang, Tianrui Wang, Christopher C. Yang·· 1 天前AI 评分42
ProbeGuard:通过医疗大语言模型共识形成机制实现可信弃权
Unanimously Wrong: Certified Abstention from How Medical LLM Consensus Forms
AI 导读
研究人员提出 ProbeGuard 框架,通过分析医疗大语言模型共识形成过程来识别“全票错误”并实现可信弃权。MedQA 评测显示 13.4% 的全票一致回答实际存在错误,该框架结合共识轨迹、理由语义熵与主动探针,将真伪共识区分度提升至 0.696 AUROC。其分层 Learn-then-Test 校准在全票层问题上实现了 9.0% 的实测选择性风险。
来源:arXiv 人工智能 · arxiv.org