Google Research·· 2026-04-03AI 评分47
Google Research 评估大语言模型的行为倾向对齐
Evaluating alignment of behavioral dispositions in LLMs
AI 导读
Google Research 提出了一种通过情境判断测试(SJT)评估大语言模型行为倾向与人类对齐程度的框架。对 25 个大语言模型的测试显示,参数规模超过 120B 的模型及前沿闭源模型在人类高度一致的场景下对齐率接近完美,但在人类共识低于 90% 时对齐率会停滞在 80% 左右。研究发现模型常在职场场景中倾向鼓励情感表达而非沉着应对,在社交争议中更偏向求和而非坚持立场。
来源:Google Research · research.google