跳到正文
原文
arXiv 自然语言处理· Sugam Panthi, Muhaiminul Yeamin, Rabab Abdelfattah·· 7 小时前AI 评分53

研究揭示大语言模型难以区分粘贴内容与用户后续输入:SEAM 基准测评

Can LLMs Separate Pasted Artifacts from User Speech? Absorption at Unmarked Prompt Seams

AI 导读

研究团队提出 SEAM 基准测试大语言模型能否区分粘贴文本与后续无标记的用户输入,发现模型普遍存在将后续用户评论误当作粘贴内容一部分处理的吸收现象。在对 20 个模型的评测中,仅用普通换行分隔时吸收发生率为 7.7% 到 66.7%,增加空行无法显著改善该问题。显式边界标记能在 19 个模型中减少吸收,但仍无法彻底消除混淆。

来源:arXiv 自然语言处理 · arxiv.org