热点事件观察中
研究团队提出代码大模型测试期强化学习框架NTRL-Code
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月29日,arXiv发布的研究提出面向代码大语言模型的测试期强化学习框架NTRL-Code。该框架仅使用测试阶段的无标签噪声数据即可实现代码大模型的鲁棒自我演进。在技术实现上,NTRL-Code通过保守自去噪获取语义锚点,利用基于抽象语法树(AST)的结构聚合机制估计代理目标,并结合格式有效性、代码相似度与抗重复的混合奖励来优化策略。实验表明,在包含字符级、词级和段落级扰动的3个基准测试中,NTRL-Code显著稳定了多种基础模型的预测表现。
AI 根据报道生成 · 8 小时前更新
最新进展9月29日 12:00
研究团队提出NTRL-Code框架,利用无标签噪声数据在测试期提升代码大模型的鲁棒性与自我演进能力。报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- arXiv 人工智能面向代码 LLM 的噪声测试期强化学习
研究提出 NTRL-Code 测试期强化学习框架,仅使用测试阶段的无标签噪声数据即可实现代码大语言模型的鲁棒自我演进。该框架通过保守自去噪获取语义锚点,利用基于 AST 的结构聚合机制估计代理目标,并结合格式有效性、代码相似度与抗重复的混合奖励优化策略。在包含字符级、词级和段落级扰动的 3 个基准测试中,NTRL-Code 显著稳定了多种基础模型的预测表现。
本事件热度走势
当前热度 4·可比范围峰值 5(9月30日 12:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。