跳到正文
原文
arXiv 自然语言处理· Yuhan Guo, Jinming Liu, Liang Xu, Ziqiang Li, Jianguo Huang, Zhicheng Wang, Hu Zhu, Qiuyu Chen, Yuntao Wei, Xin Jin, Wenjun Zeng·· 1 天前AI 评分35

EVOKE:激发智能体内化世界知识以实现可迁移决策

EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

AI 导读

研究团队提出 LLM 智能体后训练方法 EVOKE,通过在固定状态下引入多样化目标,激发模型预训练内化的世界知识以提升跨环境迁移能力。EVOKE 保持环境状态和交互历史固定,并针对不同目标对候选动作重新排序,迫使策略摆脱对表层上下文习惯的依赖。在 3 种骨干模型上的评测表明,该方法显著改善了任务表现、未见环境泛化性与数据效率。

来源:arXiv 自然语言处理 · arxiv.org