arXiv 人工智能· Zhimin Gao, Pichao Wang·· 6 小时前AI 评分43
OpenJev-RLCD:一个可运行的 RLCD 实现
OpenJev-RLCD: A Working RLCD Implementation
AI 导读
研究人员推出校准决策强化学习实现 OpenJev-RLCD,利用严格正定评分规则评估推理模型生成理由后的答案分布,以解决 RLVR 导致的过度自信。该方法采用“先校准后强化”两阶段训练方案;在 Qwen3-1.7B 上的推理测试中,RLCD 准确率持平或超越 SFT、RFT/STaR 及 GRPO,并在选择性预测中全面胜出。代码与结果已开源。
来源:arXiv 人工智能 · arxiv.org