跳到正文
原文
arXiv 自然语言处理· Omar Farouk Zouak, Houssam Eddine Boukhalfa, Soumaya Lakehal, Shiv Katiyar, Samia Nefti-Meziani·· 3 小时前AI 评分45

基于逐定理符号验证器的反例生成:模仿学习的缺陷与强化学习的修复

Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs

AI 导读

研究团队提出了反例生成框架并开源 SymCE,包含 4,707 个配有可执行 Python 验证器的错误数学猜想与训练环境。实验发现仅用反例做 SFT 会导致 Qwen3-4B 对真定理的识别率从 0.27 跌至 0.00,而采用 GRPO 稀疏奖励的 RLVR 可将其修复并提升至 0.66(在 Gemma-3-4B 上同样复现)。

来源:arXiv 自然语言处理 · arxiv.org