arXiv 自然语言处理· Fahmid Shahriar Iqbal, Ritam Dutt, Soumitra Das, Arnav Verma, Sagnik Ray Choudhury·· 5 小时前AI 评分33
大语言模型在时间抽取任务中的多维度泛化评估
Evaluating Multi-Dimensional Generalization of Large Language Models in Temporal Extraction Tasks
AI 导读
一项针对大语言模型在时间与事件表达抽取任务的研究表明,归纳提示在领域偏移、对抗扰动、组合性和长度增加四个泛化维度上表现最稳健。虽然基础任务性能强通常预示更好的泛化能力,但在大幅分布偏移下该关联显著减弱。研究指出模型规模与架构收益具有维度特异性,域内或单维度评估无法可靠推断 LLM 的时间抽取泛化能力。
来源:arXiv 自然语言处理 · arxiv.org