跳到正文
原文
arXiv 人工智能· Qilang Ye, Meng Liu, Yu Zhou·· 2 天前AI 评分41

RAO-Nav:探索全模态语言模型在零样本语义视听导航中的应用

RAO-Nav: Probing Omni-Language Models for Zero-shot Semantic Audio-Visual Navigation

AI 导读

RAO-Nav 提出了一种利用全模态语言模型(OLM)实现零样本语义视听导航(SAVN)的部署流程。该方案引入测试时潜在导航推理(LNR)模块,在无需任何训练数据的情况下,在公开 SAVN 基准测试中超越了现有的 SOTA 基线。研究还提出了全局导航指令设定以进一步评估具身智能体能力,并已开源代码。

来源:arXiv 人工智能 · arxiv.org