跳到正文
原文
arXiv 人工智能· Hantao Yu, Sandy Han, Udaya Ghai, Ferhat Erata, Joe Lilien, Aman Goel, Ali Torkamani·· 1 天前AI 评分35

指令而非答案:在在线策略上下文蒸馏中使用指令特权

Instruct, Not Answer: Using Instruction Privileges in On-Policy Context Distillation

AI 导读

研究提出在在线策略上下文蒸馏(OPCD)中使用针对常见错误的通用指令特权,以替代样本专用的标准答案。在基于 ProverQA、ProofWriter 与 ProntoQA 数据集以及 Qwen3-Thinking 和 Olmo3-Thinking 模型的 8 组实验中,匹配指令特权在 7 组中的 OOD 准确率领先标准答案 4 到 17 个百分点,且领域内表现相当。

来源:arXiv 人工智能 · arxiv.org