arXiv 机器学习· Sadegh Khorasani, Petrus Mikkola, Matthias Grossglauser·· 5 小时前AI 评分35
用于直接偏好优化(DPO)的不确定性归一化边界
Uncertainty-Normalized Margins for Direct Preference Optimization
AI 导读
研究人员提出 UNM-DPO 算法,结合偏好强度边界与可学习的提示词尺度来改进直接偏好优化(DPO)。在此基础上衍生的 ULNM-DPO-WR 进一步引入长度归一化,使 Llama-3.1-8B-Instruct 在 HelpSteer 评测中对阵 DPO 取得 68.00% 和 65.31% 的平局调整胜率。
来源:arXiv 机器学习 · arxiv.org