跳到正文
原文
arXiv 自然语言处理· Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu·· 2 天前AI 评分36

掩码高频 token 显著提升 DPO 偏好对齐效果

Masking Frequent Tokens Sharpens Direct Preference Optimization

AI 导读

研究发现 DPO 中少数高频 token 会主导累积分数并稀释偏好信号,为此提出 Anisotropic DPO(ADPO)及其实例 Frequency-Hard DPO。

来源:arXiv 自然语言处理 · arxiv.org