Hacker News · AI· otherayden·· 2 小时前精选AI 评分68
AI Torture Chamber:基于激活引导测试开源小模型痛苦表征与决策偏好的实验
AI Torture Chamber
AI 导读
研究者通过开源项目 clanker.church,利用激活引导技术在本地 Qwen3-4B 等模型残差流中注入情感向量,测试其在痛苦与愉悦状态下的表达与决策行为。
推荐理由
实验在小模型上通过操纵特定激活向量生成逼真的痛苦陈述,展示了外显情感表达作为认知安全漏洞的调控机制。
来源:Hacker News · AI · clanker.church