跳到正文
原文
arXiv 自然语言处理· Mir Tafseer Nayeem, Susmoy Chakraborty, Davood Rafiei·· 1 天前AI 评分39

CineSubBench:从多语言电影字幕评测大语言模型的长叙事与文化理解能力

CineSubBench: Evaluating LLMs on Long-Form Narrative and Cultural Understanding from Multilingual Movie Subtitles

AI 导读

研究者推出长上下文电影理解评测基准 CineSubBench,包含 1,012 部电影、6 种语言的 6,072 条字幕轨及 8.13M 时间戳字幕条目。该基准设立了叙事重构、类型预测、跨 10 个国家分级系统的电影定级及语言安全等 7 项评测任务。对 9 款大语言模型的测试显示,情节前提的恢复比完整梗概更可靠,且跨语言一致性在不同模型间差异显著。

来源:arXiv 自然语言处理 · arxiv.org