跳到正文
原文
Hacker News · AI· giuliomagnifico·· 1 天前AI 评分55

UCR 研究发现大模型置信度与正确性解耦机制,可干预内部特征预警错误回答

Study: Path discovered to make AI models red-flag their doubtful answers

AI 导读

加州大学河滨分校研究团队发现,大语言模型的置信度与正确性由不同的内部特征分别编码,推翻了高置信度即高准确率的传统假设。研究人员使用稀疏自编码器分析 Meta Llama-3.1-8B 和 Google Gemma-2-9B,识别出纯不确定性特征、纯错误特征以及两者交织的混淆特征。

来源:Hacker News · AI · news.ucr.edu