arXiv 自然语言处理· Bosi Wen, Yilin Niu, Xiaoying Ning, Ying Zhang, Hongning Wang, Minlie Huang·· 2 天前AI 评分42
ScopeIF:通过分级奖励建模提升大语言模型的作用域感知精确指令遵循
ScopeIF: Improving Scope-Aware Precise Instruction-Following in Large Language Models via Graded Reward Modeling
AI 导读
研究人员提出 ScopeIF 训练框架,通过分级奖励建模量化约束违规程度,以提升大语言模型在局部作用域下的精确指令遵循能力。该方案基于 Scope、Target 与 Range 三维解耦模式构建了大规模数据集 ScopeInstruct,并结合工具验证提供稠密监督。
来源:arXiv 自然语言处理 · arxiv.org