AIDC
← 返回全部动态
arXiv 人工智能AI 评分 62/10009月28日 12:00

LLM真的理解上下文吗?基于知识图谱的上下文理解评测框架

大语言模型虽然表现出强大的语言能力,但究竟是真正理解上下文还是仅做超大规模的模式匹配仍存争议。上下文理解要求模型能够从给定语境中准确提取信息、构建一致的内部表征并进行事实推理。传统以BLEU和困惑度为主的评估方法往往局限于表面特征,该研究提出了一种基于知识图谱的新型评测框架,旨在更深入、结构化地量化大模型对上下文的真实理解能力。

推荐理由探讨大模型核心认知能力的学术评测论文,利用知识图谱评估上下文理解度具有一定方法学参考价值。

原标题:Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework

阅读 arXiv 人工智能 原文 ↗

同一事件的其他来源

arXiv 机器学习09月29日 12:00

长程上下文学习稳态评估:基于BIRD-SQL的案例研究

该论文针对大模型的连续学习与上下文学习(ICL)评估方法展开研究。传统基准通常仅评估短程增益,本研究将ICL视作一种学习系统,在更长的共享任务流程中评估其“稳态学习”表现。以BIRD-SQL中的F1赛车数据集为例,研究综合衡量了探索效率(SQL探测次数)、任务命中率与交付成本(API费用及上下文长度)。结果显示,随着ICL上下文增长,探索试探显著减少,但命中率提升较为温和。

arXiv 自然语言处理09月28日 12:00

CARGO:面向生产环境智能体的上下文感知检索门控评测框架

针对生产环境中智能体在动态实体(如客服工单、账户等)操作时的评测难题,传统基于参考答案的 LLM-as-a-judge 方案常因参考案例与实际运行实体的标识、日期等不同而误判为幻觉或错误(即参考与实例分歧 RID)。为此,研究人员提出 CARGO 评测框架。该框架将检索到的历史参考样本视作“操作流程范例”,同时结合实时运行上下文进行事实性判定,从而显著提高了生产环境智能体评测的鲁棒性与准确率。