跳到正文
热点事件持续更新

研究团队推出跨语言知识差异问答基准Waldo

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月,研究团队推出了包含12K个问答对的多语言问答基准Waldo,用于评估大语言模型在跨语言知识缺失与冲突下的查询语言偏好。在针对5种语言和8个大模型的测试中发现,模型在面对知识缺失时能够跨语言调用证据,但在遭遇知识冲突时,回答会强烈偏向与提问语言一致的信源。针对这一偏好问题,研究团队提出了相应的LoRA训练方法,最高可将该偏好差距降低61.5%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv 自然语言处理
    大语言模型在跨语言知识差异下的查询语言偏好:Waldo 基准研究

    研究团队推出多语言问答基准 Waldo,包含 12K 个问答对,用于评估大语言模型在跨语言知识缺失与冲突下的查询语言偏好。在 5 种语言和 8 个模型的测试中,模型在知识缺失时能跨语言调用证据,但在知识冲突时回答会强烈偏向与提问语言一致的信源。研究提出的 LoRA 训练方法可将该偏好差距最高降低 61.5%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。