arXiv 自然语言处理· Mingqing Yuan (Soochow University), Xiaobo Liang (Soochow University), Junwei Yang (University of Cambridge), Ziwei Chen (Chalmers University of Technology), Zeren Zhang (Peking University), Hejin Wang (Tsinghua University), Yubin Wang (The Hong Kong University of Science,Technology), Juntao Li (Soochow University)·· 7 小时前AI 评分34
在隐空间中评判:基于保持语义压缩的高效生成式奖励建模
Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression
AI 导读
研究人员提出隐式评估框架 LatentGRM,通过语义分块、压缩与重构在连续隐式空间中完成成对偏好评判,无需逐 token 生成评估文本。在 4B 和 8B 规模下,该框架取得了与显式 SFT 评判相当的偏好准确率。在 4 个基准领域中,LatentGRM-8B 将评估轨迹压缩 8.9–9.2x,并在 vote@5 下将裁判总推理时间缩短 6.1–7.0x。
来源:arXiv 自然语言处理 · arxiv.org