跳到正文
原文
arXiv 人工智能· Rabimba Karanjai, Qun Gu, Hemanth Hegadehalli Madhavarao, Wenhuan Sun, Xiaojiao Yu, Suryabhan Singh Hada, Libin N. George, Uma Kona, Richard Williamson, Linsey Pang, Prakhar Mehrotra·· 7 小时前AI 评分39

CM-DPO:面向大语言模型规划的约束边际直接偏好优化

CM-DPO: Constraint-Margin Direct Preference Optimization for LLM Planning

AI 导读

研究人员提出面向大语言模型规划的 CM-DPO 方法,利用确定性符号验证器生成的连续边际替代 DPO 的二元偏好信号,按违规严重程度缩放并严格分离硬软约束。

来源:arXiv 人工智能 · arxiv.org