跳到正文
原文
arXiv 自然语言处理· Tar{\i}k Tuna Ta\c{s}alt{\i}, Burcu H\"udaverdi, David Semedo·· 1 天前AI 评分40

CoT-Pass@k 是否真正检验了思维链?一项多语言数学审计研究

Does CoT-Pass@k Really Check the CoT? A Multilingual Mathematical Audit

AI 导读

研究对评估模型推理的指标 CoT-Pass@k 进行了首个多语言数学基准审计,发现作为裁判的 LLM 均无法可靠检测出受损的推理链。评测显示 V4-Flash 和 Qwen3.6 等裁判主要依赖最终答案及链与答案的一致性做判定,接受损坏推理链的概率与正常链几乎相同。这导致 Pass@k 与 CoT-Pass@k 的平均差距在当前代求解模型上仅剩 4.1 分,且高度受 token 预算影响。

来源:arXiv 自然语言处理 · arxiv.org