arXiv 人工智能· Ruoming Jin, Xinyu Li, Hao Zhou, Jianfeng Zhu, Ruixin Guo, Feodor Dragan, Lei Xu, Haixun Wang, Yang Zhou·· 5 小时前AI 评分34
面向个性化偏好优化的梯度对齐偏好对选择
Gradient-Aligned Pair Selection for Personalized Preference Optimization
AI 导读
针对大语言模型个性化对齐中偏好对选择与用户效用脱钩的问题,研究提出了几何对齐偏好优化算法 GAP-DPO。该算法基于用户效用梯度与 DPO 更新方向的一阶几何交互进行效用感知偏好对选择,并通过逐轮重新生成控制分布偏移。实验表明,GAP-DPO 在个性化文本生成基准上的风格保真度、偏好对齐和生成质量均优于标准 DPO 变体。
来源:arXiv 人工智能 · arxiv.org