arXiv 自然语言处理· Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu·· 2 天前AI 评分36
掩码高频 token 显著提升 DPO 偏好对齐效果
Masking Frequent Tokens Sharpens Direct Preference Optimization
AI 导读
研究发现 DPO 中少数高频 token 会主导累积分数并稀释偏好信号,为此提出 Anisotropic DPO(ADPO)及其实例 Frequency-Hard DPO。
来源:arXiv 自然语言处理 · arxiv.org