跳到正文
原文
arXiv 人工智能· Tianruo Rose Xu, Jiawei Ren, Yichi Yang, Zhaoxu Zheng, Lianhui Qin·· 6 小时前AI 评分52

研究提出 RT-Safe:实时具身环境下的智能体安全评测基准

RT-Safe: Benchmarking Agent Safety in Real-Time Embodied Environment

AI 导读

研究人员推出实时具身智能体安全评测基准 RT-Safe,模拟包含动态行人、环境危害和交通规则的城市环境,并在模型推理与动作执行过程中保持环境动态演进。对 8 个 VLM 的评测显示,虽然智能体任务完成率较高(静态 91.3%、实时 94.1%),但实时执行使碰撞率增加了 12.3 倍,最难设置下仅 0.7% 的回合完全无安全事件。

来源:arXiv 人工智能 · arxiv.org