跳到正文
原文
arXiv 自然语言处理· Xinyi Liu, Rinat Khaziev, Dilek Hakkani-T\"ur, Tarek F. Abdelzaher·· 6 小时前AI 评分44

LongSocialBench:长上下文大语言模型能否理解在线讨论帖?

LongSocialBench: Do Long-Context LLMs Understand Online Discussion Threads?

AI 导读

研究人员推出评测长上下文大语言模型社交推理能力的基准 LongSocialBench,包含来自 Hacker News、Stack Exchange 等平台的 1,462 道选择题,中位数长度约 73K tokens。在 18 个模型的评测中,表现最佳的 Claude-Opus-4.7 取得 63.0% 的准确率,仍明显低于人类读者的 72.4%,所有模型全上下文基线平均分仅为 43.9%。

来源:arXiv 自然语言处理 · arxiv.org