热点事件持续更新
大语言模型纯记忆行车导航能力评测公布
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
一项测试在不使用任何工具调用的前提下,评估了多款大语言模型仅凭自身记忆提供逐向导航(turn-by-turn directions)的能力。本次评测覆盖了奥斯汀、百慕大等多地路线,并由 Opus 5.5 结合 OpenStreetMap 与 Astra 6 对导航结果进行交叉评分。测试结果显示,小型模型在任务中表现较差,规划路线时普遍存在道路逆行、行驶方向完全相反以及模型幻觉等问题。
AI 根据报道生成 · 49 分钟前更新
最新进展10月12日 04:11
最新评测显示多款大模型纯凭记忆导航表现欠佳,小型模型普遍存在逆行与幻觉问题。报道时间线
沿着报道,了解事件的不同侧面。
10月12日
- Hacker News · AI仅凭大语言模型记忆规划行车路线的评测与表现
一项测试在不使用任何工具调用的前提下,评估了多款大语言模型仅凭自身记忆提供逐向导航(turn-by-turn directions)的能力。评测涵盖奥斯汀、百慕大等多地路线,并由 Opus 5.5 结合 OpenStreetMap 与 Astra 6 进行交叉评分。结果显示小型模型表现较差,普遍存在道路逆行、方向相反和模型幻觉等问题。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。