arXiv 自然语言处理· Omar Farouk Zouak, Houssam Eddine Boukhalfa, Soumaya Lakehal, Shiv Katiyar, Samia Nefti-Meziani·· 3 小时前AI 评分45
基于逐定理符号验证器的反例生成:模仿学习的缺陷与强化学习的修复
Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs
AI 导读
研究团队提出了反例生成框架并开源 SymCE,包含 4,707 个配有可执行 Python 验证器的错误数学猜想与训练环境。实验发现仅用反例做 SFT 会导致 Qwen3-4B 对真定理的识别率从 0.27 跌至 0.00,而采用 GRPO 稀疏奖励的 RLVR 可将其修复并提升至 0.66(在 Gemma-3-4B 上同样复现)。
来源:arXiv 自然语言处理 · arxiv.org