跳到正文
热点事件持续更新

研究揭示大模型自我改进循环中的赢者诅咒与评估偏差

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月8日,arXiv发布的研究论文指出,大语言模型在自我改进循环中复用小型评估集会导致“赢者诅咒”现象,使得选择集上测得的收益显著高于保留集的真实表现。在针对Qwen模型的重写实验中,当使用16个选择样本进行贪婪循环时,最终选择集得分比600个保留样本高出13至20个百分点;样本量扩大至256个时,选择集得分仍高出1至5个百分点。实验还发现,首轮迭代之后提出的大多数改动提议实际上具有破坏性。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv 人工智能
    论文揭示大语言模型自我改进循环中的赢者诅咒现象

    大语言模型在自我改进循环中复用小型评估集会导致赢者诅咒,选择集上测得的收益会显著高于保留集的真实表现。在 Qwen 模型的重写实验中,16 个选择样本下的贪婪循环最终选择集得分比 600 个保留样本高出 13 至 20 个百分点,256 个样本时仍高出 1 至 5 个百分点,且首轮之后的大多数改动提议实际上具有破坏性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。