arXiv 机器学习· Younwoo Choi, Leo Feng, Vincent Liu, Haanvid Lee·· 4 小时前AI 评分34
面向大语言模型的摊销离线策略评估方法 PFN-OPE
Amortized Off-Policy Evaluation for LLMs
AI 导读
研究提出面向大语言模型离线策略评估的 PFN-OPE 方法,通过先验数据拟合网络解决持续部署中的策略偏移与奖励偏移问题。该模型经预训练后,测试时仅需单次前向传播即可输出估值,无需针对新任务重新拟合。在 HelpSteer2 和 UltraFeedback 上测试 Qwen、Llama 及 Gemma 策略,其在奖励偏移下的误差比最佳基线降低 2.0 至 9.3 倍。
来源:arXiv 机器学习 · arxiv.org