跳到正文
原文
arXiv 机器学习· Abhinav Rajput, Acey Vogelstein·· 6 小时前AI 评分35

帕累托主导澄清:基于 PPO-Lagrangian 预算约束后训练代码大语言模型

Pareto-Dominant Clarification: Post-Training Coding LLMs via PPO-Lagrangian Budget Constraints

AI 导读

研究人员将交互澄清决策建模为 CMDP,利用 PPO-Lagrangian 对 Qwen2.5-Coder-7B-Instruct 开展提问预算约束后训练。在 HumanEvalComm 评测中,该策略相比基线同时实现了更高准确率与更低提问率,呈现出对数型帕累托前沿。模型无需显式监督即可将预算更多分配给复杂任务,揭示了未受约束交互式大语言模型的澄清低效现象。

来源:arXiv 机器学习 · arxiv.org