arXiv 自然语言处理· Lukas Thede, Yash Kumar Atri, David Chen, Danielle Bitterman, Matthias Bethge, Tom Hartvigsen, Zeynep Akata·· 1 天前AI 评分42
MedKIT:评估大语言模型的知识整合与泛化能力
MedKIT: Evaluating Knowledge Integration and Generalization in Large Language Models
AI 导读
研究人员推出评测基准 MedKIT,用于在临床证据更新场景下细粒度评估大语言模型的知识整合与应用能力。基于 5 款通用及医疗 LLM 与 12 种知识整合策略的实验显示,多数方法虽能提升原始事实回忆和词汇变体表现,但在关系泛化、组合推理与开放操作任务上均缺乏有效提升,揭示了事实回忆与知识实际可用之间的差距。
来源:arXiv 自然语言处理 · arxiv.org