跳到正文
热点事件持续更新

研究团队提出分层信用分配方法HarA优化大模型RLVR推理

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月6日,arXiv发布的研究论文提出了一种针对基于组的RLVR(可验证奖励强化学习)方法的分层信用分配框架HarA。该研究旨在通过识别并激励语义上新颖的推理行为,增强大语言模型的探索能力。在技术实现上,HarA将rollout建模为隐藏状态与位置的分布,通过计算Fused Gromov-Wasserstein(FGW)重心来度量语义新颖度,并引入锚点引导线性化,从而利用Sinkhorn算法实现高效求解。实验结果表明,HarA作为即插即用方法,在3种基于组的RLVR方法及多个推理基准测试中均优于现有方法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. arXiv 机器学习
    基于 Fused Gromov-Wasserstein 几何的 RLVR 分层信用分配研究

    研究提出了针对基于组的 RLVR 方法的分层信用分配方法 HarA,旨在识别并激励语义上新颖的推理行为以增强大语言模型的探索能力。HarA 将 rollout 建模为隐藏状态与位置的分布,通过计算 FGW 重心度量语义新颖度,并引入锚点引导线性化以利用 Sinkhorn 算法高效求解。实验表明,该即插即用方法在 3 种基于组的 RLVR 方法及多个推理基准上均优于现有方法。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。