arXiv 机器学习· Abhinav Rajput, Acey Vogelstein·· 6 小时前AI 评分35
帕累托主导澄清:基于 PPO-Lagrangian 预算约束后训练代码大语言模型
Pareto-Dominant Clarification: Post-Training Coding LLMs via PPO-Lagrangian Budget Constraints
AI 导读
研究人员将交互澄清决策建模为 CMDP,利用 PPO-Lagrangian 对 Qwen2.5-Coder-7B-Instruct 开展提问预算约束后训练。在 HumanEvalComm 评测中,该策略相比基线同时实现了更高准确率与更低提问率,呈现出对数型帕累托前沿。模型无需显式监督即可将预算更多分配给复杂任务,揭示了未受约束交互式大语言模型的澄清低效现象。
来源:arXiv 机器学习 · arxiv.org