跳到正文
原文
arXiv 人工智能· William Hoy, Jingxuan Fan, Nurcin Celik, Xu Pan·· 5 小时前AI 评分34

长程智能体任务中演化策略的异步化近乎零成本

Asynchronous Is Nearly Free for Evolution Strategies on Long-Horizon Agentic Tasks

AI 导读

新研究提出有界过时异步演化策略(ES),在 Endless Terminals 基准与 Qwen2.5-7B-Instruct 上实现媲美同步方案的效果。自然 Async-1 取得 25.9% 的留出成功率(同步 ES 为 25.4%),受控延迟更新也仅下降 1.6 与 3.1 个百分点。尽管 GRPO 整体成功率达 29.0%,该结果首次证明 ES 能良好容忍策略过时,使异步优化近乎零成本。

来源:arXiv 人工智能 · arxiv.org