arXiv 机器学习· Sofia Torres, Gabriel Almeida, Carter Adams, Camila Rocha·· 5 小时前AI 评分39
外部引导何时有助于大语言模型推理?GA-GRPO 的偏差-方差理论分析
When Does External Guidance Help LLM Reasoning? A Bias-Variance Theory of Guidance-Augmented GRPO
AI 导读
研究提出统一理论框架 GA-GRPO,将 LUFFY、ExPO、PAPO 和 TAPO 等外部引导方法统一定义为偏置同策略估计器,并推导出闭式最优引导权重公式与收敛界。在 Qwen2.5-Math-7B-Base 模型上的 9 个数学及 OOD 基准测试中,最优权重 GA-GRPO 性能媲美或超越现有方法,同时减少了 31% 的 GPU-hours 算力消耗。
来源:arXiv 机器学习 · arxiv.org