跳到正文
热点事件持续更新

苹果研究团队提出强化学习方法RLTL;DR

1 篇报道1 个报道来源18 小时前更新

先了解这件事

AI 综述

2026年10月1日,苹果机器学习研究团队提出强化学习方法RLTL;DR,旨在解决模型在极难任务下的自我提升难题。该方法通过让模型在失败后自生成单句洞察,并反向传播内化映射。实验结果显示,在Pass@128为0的极难工具调用与代码任务中,Qwen 3.5 9B Thinking经标准GRPO训练后的Pass@1仅为0%–1%,而采用RLTL;DR在评测阶段无上下文洞察的情况下,将Pass@1提升至12%–13%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. Apple Machine Learning Research
    RLTL;DR:通过内化自生成反馈实现自我提升

    研究团队提出强化学习方法 RLTL;DR,通过让模型在失败后自生成单句洞察并反向传播内化映射,解决极难任务下的自我提升难题。在 Pass@128 = 0 的工具调用与代码任务中,Qwen 3.5 9B Thinking 经标准 GRPO 训练的 Pass@1 仅 0%–1%,而 RLTL;DR 在评测无上下文洞察时将 Pass@1 提升至 12%–13%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。