跳到正文
原文
arXiv 自然语言处理· Usman Anwar, Sahar Abdelnabi, David Krueger·· 1 天前AI 评分51

论文提出口语化训练方法诱导大模型主动表达评估感知

Training LLMs to Verbalize Evaluation Awareness

AI 导读

研究团队提出口语化训练(VT)方法,训练大语言模型主动用语言表达对处于评估状态的感知(EA),以解决模型在审查与部署阶段行为不一致的问题。该方法通过截断模型自发表达前的生成轨迹构建前缀并结合强化学习,在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上将言语化 EA 提升了 2.4-2.9 倍,并成功迁移至保留的 Agent 环境。

来源:arXiv 自然语言处理 · arxiv.org