跳到正文
原文
arXiv 人工智能· Uttamasha Monjoree, Wei Yan·· 4 小时前AI 评分34

微调视觉语言模型提升空间智能:理解 2D 与 3D 旋转

Fine-Tuning VLM for Enhancing AI's Spatial Intelligence: Understanding 3D and 2D Rotations

AI 导读

研究人员通过多套物体旋转数据集微调视觉语言模型(VLM),显著提升了模型在 2D 与 3D 旋转检测中的空间智能表现。实验显示,微调后的 Google DeepMind Gemma-4 MoE 模型在预测旋转轴和角度上显著优于 Gemma-4 通用模型,且 2D 角度估计无需显式坐标系即可大幅改善。此外,具备突出线性特征的物体能有效提升角度检测精度。

来源:arXiv 人工智能 · arxiv.org