跳到正文
热点事件观察中

医疗交互评测基准KlinikeBench发布

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月1日,研究团队推出医疗评测基准KlinikeBench,通过333个虚拟病人沙箱任务评估语言模型在完整问诊与临床评估中的综合表现。在针对31个模型和7个模型族的评测中,顶尖模型GPT-6-astra与Claude Opus 5的诊断准确率达到了90.7%,但整体任务成功率均低于30%。该基准揭示了语言模型在交互式临床评估能力与单纯诊断准确率之间存在显著差距。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv 自然语言处理
    KlinikeBench:超越诊断准确率评估语言模型

    研究团队推出医疗评测基准 KlinikeBench,通过 333 个虚拟病人沙箱任务评估语言模型在完整问诊与临床评估中的表现。在 31 个模型和 7 个模型族的评测中,顶尖模型 GPT-6-astra 与 Claude Opus 5 诊断准确率达 90.7%,但整体任务成功率低于 30%。该基准揭示了模型在交互式临床评估与单纯诊断准确率之间的显著差距。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。