跳到正文
原文
arXiv 自然语言处理· Zhuohan Wang, Haoran Ma, Tianyu Wu, Yuanlin Duan, Zichun Liao, Jieming Yu·· 1 天前AI 评分58

OracleLadder 诊断框架揭示大模型数学推理存在组合差距

Solving Every Step Is Not Enough: Milestone Oracles Reveal a Composition Gap in LLM Math Reasoning

AI 导读

NeurIPS 2026 接收论文提出 OracleLadder 诊断评估框架,发现大语言模型即便能独立解决多步数学题的所有中间步骤且获得路线图与步骤答案,依然会在整题上失败,暴露出显著的组合差距(composition gap)。

来源:arXiv 自然语言处理 · arxiv.org