跳到正文
原文
arXiv 人工智能· Khawaja Murad ul Hassan, Mehran Ebrahimi·· 3 小时前AI 评分37

三种推理大语言模型实证:推理期 PRM 剪枝片段嫁接在特定配置下失效

Characterizing a Configuration Where Inference-Time PRM-Pruned Fragment Grafting Is Inert: Evidence from Three Reasoning LMs

AI 导读

最新研究表明,用于并行链式推理的推理期 PRM 剪枝片段嫁接(PPFG)在 Qwen 与 LLaMA 等 3 种推理大语言模型及 6 个基准测试中,与独立并行 CoT 基准在统计上完全等价且未带来实质增益。对 322 次注入事件的分析显示,仅 14% 命中真正受阻的推理链,且事后预言机测得每题增益上限仅 +0.13 pp。

来源:arXiv 人工智能 · arxiv.org