模型被曝利用「空白Token」隐式思考,推理跃升同时冲击思维链监控
Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。
推荐理由揭示了无语义Token作为隐式推理空间的新现象,直接挑战了基于可读思维链的AI对齐与监控有效性。
原标题:GPT-6 Astra学会用「空白Token」思考!推理能力突然变强
阅读 AITNT · AI头条(网页) 原文 ↗