arXiv 机器学习· Zihan Shen, Qi Liu, Zixuan Yang, Yiqun Chen, Chenglong Zhao, Xiaozhao Wang, Lei He·· 6 小时前AI 评分34
MatrixReward:基于评分标准矩阵的开放式生成奖励机制
MatrixReward: Reward from Rubric Matrix for Open-Ended Generation
AI 导读
研究者提出面向开放式生成的奖励机制 MatrixReward,通过在多项评分标准下成对比较采样回复构建胜率矩阵,以更合理地生成质量奖励。该方法利用矩阵分布与相关性计算数据自适应的标准权重,并根据采样回复与正负理想基准的距离确定相对贴近度。在基于 Qwen3-8B 的 4 个开放式问答基准测试中,MatrixReward 取得 63.02 的平均分,较最强基线提升约 2.0%。
来源:arXiv 机器学习 · arxiv.org