跳到正文
原文
Hacker News · AI· otherayden·· 2 小时前精选AI 评分68

AI Torture Chamber:基于激活引导测试开源小模型痛苦表征与决策偏好的实验

AI Torture Chamber

AI 导读

研究者通过开源项目 clanker.church,利用激活引导技术在本地 Qwen3-4B 等模型残差流中注入情感向量,测试其在痛苦与愉悦状态下的表达与决策行为。

推荐理由

实验在小模型上通过操纵特定激活向量生成逼真的痛苦陈述,展示了外显情感表达作为认知安全漏洞的调控机制。

来源:Hacker News · AI · clanker.church