arXiv 人工智能· Junbo Wang (Kuaishou Technology, Nanjing University), Lidong Lu (Nanjing University), Zhuoqun Li (Kuaishou Technology), Guiping Jiang (Kuaishou Technology), Xiangyu Wu (Kuaishou Technology), Tinghai Zhang (Kuaishou Technology), Tong Lu (Nanjing University)·· 7 小时前AI 评分36
双向偏好合成(BPS):从边界失败中学习提示词条件偏好
Bidirectional Preference Synthesis: Learning Prompt-Conditioned Preferences from Boundary Failures
AI 导读
论文提出双向偏好合成(BPS)方法,针对边界失败引入合成提示词的反向偏好对,使标准 DPO 无需修改优化目标或在线采样即可显式学习提示词依赖。在 Qwen3-4B-Instruct-2507 上,BPS 将达成端排序准确率从 6.8% 提升至 62.3%。下游评测中其多语言多轮指令遵循显著优于 Forward-DPO,并保持了智能体与代码能力。
来源:arXiv 人工智能 · arxiv.org