跳到正文
原文
arXiv 自然语言处理· Xueting Fang, Zehui Li, Yang Yang, Camilla Giovino, Shubh K. Patel, Shailly Prajapati, Vallijah Subasri, Caihua Shan·· 1 天前AI 评分50

KlinikeBench:超越诊断准确率评估语言模型

KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

AI 导读

研究团队推出医疗评测基准 KlinikeBench,通过 333 个虚拟病人沙箱任务评估语言模型在完整问诊与临床评估中的表现。在 31 个模型和 7 个模型族的评测中,顶尖模型 GPT-6-astra 与 Claude Opus 5 诊断准确率达 90.7%,但整体任务成功率低于 30%。该基准揭示了模型在交互式临床评估与单纯诊断准确率之间的显著差距。

来源:arXiv 自然语言处理 · arxiv.org