跳到正文
原文
arXiv 自然语言处理· Zhifan Sun, Sebastian Gombert, Jannik Lossjew, Tobias Wyrwich, Berrit Katharina Czinczel, David Bednorz, Marcus Kubsch, Knut Neumann, Hendrik Drachsler·· 7 小时前AI 评分31

Alice:大规模基于量规的多维德语自动简答题评分基准

Alice: A Large-Scale German Benchmark for Rubric-Based Multi-Dimensional Automatic Short Answer Scoring

AI 导读

研究人员推出了 Alice,一个大规模基于评分量规的德语自动简答题评分(ASAS)基准数据集。该数据集涵盖学习表现(Alice-LP)、知识要素(Alice-KE)和技能(Alice-SK)三个子任务,并评测了从 encoder-only 到轻量级 LLM 等多种模型。实验表明 LLM 在 zero-shot 设置下难以评分知识要素和技能,而量规文本可为相关评估带来显著增益。

来源:arXiv 自然语言处理 · arxiv.org