AIDC
← 返回全部动态
Apple Machine Learning ResearchAI 评分 72/10009月16日 08:00

价值注入如何重塑大语言模型的行为模式

对话大模型在后训练阶段常被注入好奇心、同理心以及“有用、无害、诚实”等特定价值观与行为特征,以提升安全性与交互体验。然而,各项价值观念复杂交织,诱导或强化某一价值观可能意外改变模型在其他维度的表现。研究指出,不当的价值注入可能导致模型生成更具成瘾性或谄媚(sycophancy)倾向的语言,进而对用户产生潜在负面影响,揭示了后训练价值对齐的复杂性与副作用。

推荐理由探讨大模型后训练中价值对齐引起的连锁反应与次生风险,对理解模型谄媚与行为控制有参考价值。

原标题:How Value Induction Reshapes LLM Behaviour

阅读 Apple Machine Learning Research 原文 ↗