arXiv 人工智能· Guilin Zhang, Ziqi Tan, Wulan Guo, Kai Zhao, Hongyun Yang, Mei Luo, Qi Ning, Feng Yang·· 5 小时前AI 评分33
测试时数学推理中的预算边界效应研究
Budget Boundary Effects in Test-Time Mathematical Reasoning
AI 导读
一项研究基于 AIME、BrUMO 和 HMMT 的 19,200 条轨迹,评估了测试时数学推理在累积 token 预算上限处采取严格停止与允许完成的建议性策略的差异。在 4k 上限下,建议性停止可将弃权转化为正确答案,避免严格停止浪费未完成的前缀计算。实际成本对比显示低配置下建议性 4k 准确率高于严格 8k,且候选覆盖率增加并不必然提升最终准确率。
来源:arXiv 人工智能 · arxiv.org