arXiv 自然语言处理· Eric Fithian, Kirill Skobelev, X. Y. Han·· 1 天前AI 评分44
DRY-SFT:用于提升大语言模型解题覆盖率的自监督微调方法
Don't Repeat Yourself: Self-Supervised Fine-Tuning for Coverage
AI 导读
研究提出 DRY-SFT 后训练方法,无需奖励模型、验证器或正确性过滤,通过多轮差异化生成与独立微调提升大语言模型的输出多样性与解题覆盖率。在 HumanEval+、MBPP+ 和 DS-1000 基准上,该方法将 pass@100 分别提升 10.8、12.5 和 12.4 个百分点。
来源:arXiv 自然语言处理 · arxiv.org