跳到正文
原文
arXiv 人工智能· Jingtan Wang, Sirajul Salekin, Young mok Jung, Javier Movellan, Bryan Kian Hsiang Low, Manjot Bilkhu·· 6 小时前AI 评分34

RISED:用于智能体多环境数据选择与自我蒸馏的评判标准框架

RISED: RubrIcs for agentic multi-environment Selection and sElf-Distillation

AI 导读

研究提出多环境 LLM 智能体训练框架 RISED,利用跨环境共享的评判标准(rubrics)指导在线数据选择与策略监督。该方法通过 LLM judge 标注行为,由正向标准为 on-policy 自我蒸馏提供 token 级特权监督,负向标准规避复发失败。实验中 RISED 跨多个骨干模型取得最高跨环境平均通过率,在各独立环境中均位列前两名。

来源:arXiv 人工智能 · arxiv.org