跳到正文
原文
arXiv 机器学习· Eray Turkel, Mengsha Sun, Kartik Ayyar, Sean Dunigan, Jack Lu, Vlad Shcherban, Hsiang-Shun Shih, Xin Wang, Tiantian Zhang·· 5 小时前AI 评分49

OpenGameEval:有状态游戏引擎中的智能体编程与探索评测基准

OpenGameEval: Benchmarking Agentic Programming and Exploration in a Stateful Game Engine

AI 导读

OpenGameEval 是针对 Roblox Studio 内智能体游戏开发的评测基准框架,通过 8 工具动作空间将观察与编辑分离以直接度量探索行为。对 13 个前沿模型在 84 个核心任务的评测显示,最优模型单次尝试通过率为 51.7%,5 次全通过率为 39.4%,且有 6 个任务无模型攻克。相关任务集、Roblox Studio 插件与排行榜已在 MIT 协议下开源。

来源:arXiv 机器学习 · arxiv.org