arXiv 人工智能· Yuxuan Fan, Jaehong Yoon·· 6 小时前AI 评分34
MetaRubric:面向基于量规强化学习的奖励学习
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
AI 导读
MetaRubric 通过交替执行证据感知策略优化与响应引导的量规自适应,解决强化学习中回答缺失关键信息仍获高分的 Vacuous Credit 问题。该方法结合反事实样本严格按证据给分,在多个骨干模型上相比静态裁判 GRPO 将 PubMedQA 准确率提升 6.00 至 20.40 个百分点,并在 HealthBench-Hard 及两个多模态医学基准上取得增益。
来源:arXiv 人工智能 · arxiv.org