arXiv 自然语言处理· Yida Cai, Xin Dai, Bingxiang He, Huiyuan Xie, Yuxiao Ye, Zhenghao Liu, Yang Bai, Zhiyuan Liu·· 1 天前AI 评分32
LexReward:分类驱动的法律大语言模型奖励框架
LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models
AI 导读
研究者提出面向法律大语言模型的分类驱动奖励框架 LexReward,从风格(Style)、要素(Element)和推理链(Chain)三个互补维度评估法律回答质量。该框架通过详细量规构建成对偏好数据用于 DPO 训练,实验表明其能有效提升模型在全部三个维度的表现。训练所得的奖励模型 LexRM 还支持在无参考答案的情况下,通过强化学习优化下游策略表现。
来源:arXiv 自然语言处理 · arxiv.org