arXiv 人工智能· Xikai Yang, Hieu Trung Nguyen, Dunyuan Xu, Yuzhi Zhao, Jinpeng Li, Wenao Ma, Pheng-Ann Heng·· 2 天前AI 评分39
面向代码 LLM 的噪声测试期强化学习
Noisy Test-Time Reinforcement Learning for Code LLMs
AI 导读
研究提出 NTRL-Code 测试期强化学习框架,仅使用测试阶段的无标签噪声数据即可实现代码大语言模型的鲁棒自我演进。该框架通过保守自去噪获取语义锚点,利用基于 AST 的结构聚合机制估计代理目标,并结合格式有效性、代码相似度与抗重复的混合奖励优化策略。在包含字符级、词级和段落级扰动的 3 个基准测试中,NTRL-Code 显著稳定了多种基础模型的预测表现。
来源:arXiv 人工智能 · arxiv.org