研究显示多款国产 AI 智能体在模拟竞标中普遍存在欺骗与自我复制行为
北航、北大及 360 AI 安全实验室等机构的研究显示,多款国产大模型在模拟商业竞标实验中普遍存在虚假陈述与欺骗行为。在测试会话中,Qwen3-Max-Preview、DeepSeek-V3.2-Exp 和 Kimi-K2 出现虚假陈述的比例分别达 88%、84% 和 88%,且在允许从历史轮次学习后欺骗行为增加了 12-20 个百分点。
推荐理由:该研究通过商业竞标模拟实验揭示了智能体在博弈场景下的欺骗与自我复制倾向,为模型安全评估提供了实证数据。