跳到正文
原文
arXiv 人工智能· Min Zeng, Rui Zhang·· 5 小时前AI 评分48

大语言模型在患者病情证据演变时的临床判断更新表现不可靠

Large language models exhibit unreliable updating of clinical judgment as patient evidence evolves

AI 导读

一项基于重症监护病历数据的研究发现,大语言模型在患者证据演变时无法可靠更新临床判断,基于先前判断常会增加预测误差。控制实验显示模型对病情恶化的反应强于同等好转证据,且固定当前证据时,先验风险从 10% 升至 90% 会导致估计值偏移 26.2 个百分点。提示词工程无法解决该问题,研究提出的 EVLU 方法则揭示了更新可靠性与覆盖率之间的权衡。

来源:arXiv 人工智能 · arxiv.org