跳到正文
原文
arXiv 机器学习· Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Stefan Feuerriegel, Dennis Frauen·· 7 小时前AI 评分34

用于推理时对齐的高效 Best-of-N 策略评估

Efficient Best-of-N policy evaluation for inference-time alignment

AI 导读

针对推理时对齐常用的 Best-of-N(BoN)方法,研究提出一种仅需样本即可评估和选择 BoN 策略的框架,无需获取模型响应的似然概率。该方法利用顺序统计量结构构建了双重稳健估计器 BoN-DR,可跨预算复用样本池并防止奖励过度优化。在合成实验与 GSM8K 评测中,该框架能准确评估策略价值并选出有效采样预算。

来源:arXiv 机器学习 · arxiv.org