跳到正文
原文
arXiv 自然语言处理· Krithik Vishwanath, Haitong Lin, Anton Alyakin, Jin Vivian Lee, D. Brock Hewitt, Jie J. Yao, William Robert Small, Hammad A. Khan, Cordelia Orillac, Aakaash Varma, Brandon Ye, Daniel Alexander Alber, Gustavo Stolovitzky, Batia Wiesenfeld, Oded Nov, Wei Wu, Kang Zhang, Yindalon Aphinyanaphongs, Tim Requarth, Eric Karl Oermann, The International Digital Twin Consortium in Healthcare, Medicine·· 8 小时前AI 评分63

临床医生使用大语言模型的实际场景与现有评测基准存在显著偏差

Clinician use of language models diverges from how the models are evaluated

AI 导读

最新研究通过分析 6,342 名临床医护人员发送的 127,833 条真实查询发现,大语言模型在医疗领域的实际应用与现有基准评测脱节。文档与行政管理(36.2%)以及知识检索(28.9%)构成了近三分之二的实际用途,而诊断仅占 3.7%,且超过三分之一的查询按原始输入无法得到妥善回答。

来源:arXiv 自然语言处理 · arxiv.org