AITNT · AI头条(网页)·· 6 小时前AI 评分58
VA-Bench 空间智能评测:大模型理解接近满分但物理执行成功率仅约五成
看懂不等于做对:VA-Bench测出大模型空间智能的执行断层
AI 导读
研究团队提出具身空间智能评测基准 VA-Bench,测试 12 个多模态模型发现,Qwen3.8-max、Opus-5 和 GPT-5.6-sol 在目标识别定位与语义理解上达到 99% 以上,但完整操作成功率仅在 51.55% 至 53.93%。基准包含 14 类单双臂任务共 280 个物理场景,实验表明模型在细粒度空间执行、从发现错误到在线修正、双臂协同以及长时序组合任务中存在显著能力断层。
来源:AITNT · AI头条(网页) · aitntnews.com