跳到正文
原文
arXiv 人工智能· Zhongan Bi, Kepeng Lin, Xuanang Gao, Yuhan Sun, Lianrun Zhang·· 11 小时前AI 评分43

多模态强化学习研究:视觉敏感度不等于主张撤回性,提出持久性感知信用分配 PACG

Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

AI 导读

研究人员针对多模态强化学习提出持久性感知信用分配方法 PACG,通过削弱异常持久视觉主张的正向信用,解决未受图像支持的主张错误继承奖励的问题。该方法无需标注且不增加推理成本。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 和 VPPO 的 9 项基准平均分分别提升至 59.9% 和 60.9%,并提升了 HallusionBench 准确率。

来源:arXiv 人工智能 · arxiv.org