arXiv 人工智能· Uttamasha Monjoree, Wei Yan·· 4 小时前AI 评分34
微调视觉语言模型提升空间智能:理解 2D 与 3D 旋转
Fine-Tuning VLM for Enhancing AI's Spatial Intelligence: Understanding 3D and 2D Rotations
AI 导读
研究人员通过多套物体旋转数据集微调视觉语言模型(VLM),显著提升了模型在 2D 与 3D 旋转检测中的空间智能表现。实验显示,微调后的 Google DeepMind Gemma-4 MoE 模型在预测旋转轴和角度上显著优于 Gemma-4 通用模型,且 2D 角度估计无需显式坐标系即可大幅改善。此外,具备突出线性特征的物体能有效提升角度检测精度。
来源:arXiv 人工智能 · arxiv.org