跳到正文
热点事件持续更新

大语言模型纯记忆行车导航能力评测公布

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

一项测试在不使用任何工具调用的前提下,评估了多款大语言模型仅凭自身记忆提供逐向导航(turn-by-turn directions)的能力。本次评测覆盖了奥斯汀、百慕大等多地路线,并由 Opus 5.5 结合 OpenStreetMap 与 Astra 6 对导航结果进行交叉评分。测试结果显示,小型模型在任务中表现较差,规划路线时普遍存在道路逆行、行驶方向完全相反以及模型幻觉等问题。

AI 根据报道生成 · 49 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月12日
  1. Hacker News · AI
    仅凭大语言模型记忆规划行车路线的评测与表现

    一项测试在不使用任何工具调用的前提下,评估了多款大语言模型仅凭自身记忆提供逐向导航(turn-by-turn directions)的能力。评测涵盖奥斯汀、百慕大等多地路线,并由 Opus 5.5 结合 OpenStreetMap 与 Astra 6 进行交叉评分。结果显示小型模型表现较差,普遍存在道路逆行、方向相反和模型幻觉等问题。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。