跳到正文
原文
arXiv 自然语言处理· Eftekhar Hossain, John Salvador, Santu Karmaker·· 1 天前AI 评分35

评估大语言模型能否可靠连接叙事碎片:多领域文本补全基准评测

Evaluating Whether LLMs Can Reliably Connect the DOTs?

AI 导读

一项新研究构建了包含约 9.2K 实例的多领域基准,评测 20 款 1.5B 至 70B 参数的开源大语言模型在叙事文本补全任务上的表现。结果显示模型规模无法可靠预测补全质量,小模型 Gemma-2-2B 以 4.02/5 的定性评分超越了规模大十倍以上的 DeepSeek-Qwen-32B(3.77/5)与 LLaMA-3.3-70B(3.71/5)。

来源:arXiv 自然语言处理 · arxiv.org