跳到正文
原文
arXiv 人工智能· Yuxuan Fan, Jaehong Yoon·· 6 小时前AI 评分34

MetaRubric:面向基于量规强化学习的奖励学习

MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning

AI 导读

MetaRubric 通过交替执行证据感知策略优化与响应引导的量规自适应,解决强化学习中回答缺失关键信息仍获高分的 Vacuous Credit 问题。该方法结合反事实样本严格按证据给分,在多个骨干模型上相比静态裁判 GRPO 将 PubMedQA 准确率提升 6.00 至 20.40 个百分点,并在 HealthBench-Hard 及两个多模态医学基准上取得增益。

来源:arXiv 人工智能 · arxiv.org