arXiv 自然语言处理· Hala Almaghout, Christian Federmann, Qin Gao·· 6 小时前AI 评分38
LLM 用于机器翻译质量标注:人类与模型均面临挑战
Large Language Models for Machine Translation Quality Annotation: Humans and Models Are Both Challenged
AI 导读
研究评估了 LLM 在 MQM 和 ESA 两种机器翻译质量评测方案下的表现,发现 LLM 与人类标注者的一致性在多数场景下依然不可靠。该研究基于涵盖 70 种语言对的长上下文测试集及 WMT23、WMT25 公开数据进行测试。结果显示人类在细粒度 MQM 和低资源语言上受限,而 LLM 则难以应对轻微错误、语言变体及错误跨度标注。
来源:arXiv 自然语言处理 · arxiv.org