arXiv 自然语言处理· Zhifan Sun, Sebastian Gombert, Fabian Zehner, Leon Camus, Longwei Cong, Hendrik Drachsler·· 8 小时前AI 评分34
评分标准跨度即标签表征:面向简答题评分的大语言模型联合编码
Rubric Spans are Label Representations: Joint LLM Encoding for Short Answer Scoring
AI 导读
研究者提出简答题自动评分框架 RUSPAN,将评分标准描述作为语义标签表征,通过单次语言模型编码实现上下文与评分等级的联合列表式打分。扩展方案 RUSPAN-RIM 引入评分标准独立掩码与位置重索引,防止标准间相互注意力过拟合以增强零样本迁移能力。在涵盖英语、德语和葡萄牙语的 6 个 ASAS 基准上,该方法优于判别式与生成式基线,并在 PT-ASAG 测试中取得显著提升。
来源:arXiv 自然语言处理 · arxiv.org