跳到正文
原文
Apple Machine Learning Research·· 19 小时前AI 评分49

RLTL;DR:通过内化自生成反馈实现自我提升

RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback

AI 导读

研究团队提出强化学习方法 RLTL;DR,通过让模型在失败后自生成单句洞察并反向传播内化映射,解决极难任务下的自我提升难题。在 Pass@128 = 0 的工具调用与代码任务中,Qwen 3.5 9B Thinking 经标准 GRPO 训练的 Pass@1 仅 0%–1%,而 RLTL;DR 在评测无上下文洞察时将 Pass@1 提升至 12%–13%。

来源:Apple Machine Learning Research · machinelearning.apple.com