跳到正文
原文
arXiv 人工智能· Jirui Dai, Chenkai Zhang, Yan Jia, Yukai Wang, Ruiyang He, Changyong Luo, Zhi Liu·· 5 小时前AI 评分35

TCMClinicalReason-Bench:大语言模型能否在真实临床病例中从病机推理至方剂?

TCMClinicalReason-Bench: Can Language Models Reason from Pathogenesis to Prescription over Real-World Clinical Cases?

AI 导读

研究者基于 2,000 例电子病历构建 TCMClinicalReason-Bench,评估大语言模型从中医病机到方剂的推理能力。评测 5 款通用与 2 款中医专用 LLM 显示,结构完整度虽达 99.3%-100.0%,但内容得分仅 40.7%-54.1%。模型在处方生成与随症加减上缺陷显著,通用模型平均得分(50.0%)优于中医专用模型(41.3%)。

来源:arXiv 人工智能 · arxiv.org