跳到正文
原文
arXiv 自然语言处理· Taye Akinrele, Noorbakhsh Amiri Golilarz, Subash Neupane, Sudip Mittal, Shahram Rahimi·· 5 小时前AI 评分43

LLM 能否实现长跨度推理?纵向临床推理上下文策略实证评估

Can LLMs Reason Over Long Horizons? An Empirical Evaluation of Context Strategies for Longitudinal Clinical Reasoning

AI 导读

一项研究在 MedLoCoMo 基准上评估了 4 款开源 LLM 的 5 种上下文策略(Full、Recent、Episodic、Semantic 和 Hybrid),发现 Episodic 与 Hybrid 策略整体准确率最高且在长距离证据下表现最稳健。相比之下,Recent 策略随证据距离增加性能下滑最严重;同时模型在可回答问题上的高表现,并未有效转化为对缺乏依据问题的弃权能力。

来源:arXiv 自然语言处理 · arxiv.org