模型被曝利用「空白Token」隐式思考,推理跃升同时冲击思维链监控
Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。
Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。
当前大模型在评审他人代码时,即使缺乏证据也会给出看似自信的虚假判断。多智能体验证机制通过将评审拆解为可检验声明来缓解该问题。该论文指出,有效的多智能体证据需满足两个关键条件:独立于被审查答案,且能在对比候选代码间体现差异。研究提出了两套无标注评估指标,并设计了一种在缺乏充分证据时主动拒绝盲猜的代码评审机制,以提升大模型代码评估的可靠性与扎实度。
评估可解释人工智能(XAI)方法一直面临缺乏可靠评估程序及真实解释基准(ground truth)的挑战。现有评估通常仅测量解释与黑盒模型预测之间的忠实度(fidelity),但这仅量化了解释复现模型输出的程度,无法确保其真实反映底层的决策过程。为此,该研究提出了一个合成真实基准框架,旨在解决不同解释方法难以进行客观真实度评测的难题。
本研究提出了一种基于图神经网络(SchNet)预测跨膜蛋白拓扑结构的新方法。与传统仅依赖蛋白序列或α-碳骨架特征的方法不同,该模型直接利用全原子级嵌入特征进行拓扑推断。在与DeepTMHMM相同的基准数据集上进行5折交叉验证,研究表明在不使用任何预训练权重的情况下,GNN在该任务上表现出良好潜力,展示了3D结构信息在蛋白拓扑预测中的应用价值。
针对离散扩散模型在奖励最大化对齐中主要依赖单向引导逆过程、缺乏回溯修正机制的问题,研究人员提出了 Spectral Feedback(谱反馈)算法。该方法在反馈循环中自适应选择编辑位置,利用离散扩散模型的掩码结构进行重新掩码和重采样,使模型能够在推理阶段迭代修正自身生成结果,有效提升了蛋白质设计等任务中的对齐表现。
大语言模型虽然表现出强大的语言能力,但究竟是真正理解上下文还是仅做超大规模的模式匹配仍存争议。上下文理解要求模型能够从给定语境中准确提取信息、构建一致的内部表征并进行事实推理。传统以BLEU和困惑度为主的评估方法往往局限于表面特征,该研究提出了一种基于知识图谱的新型评测框架,旨在更深入、结构化地量化大模型对上下文的真实理解能力。
来自全球22个研究团队联合推出了BioEVAL基准,旨在评估大语言模型和多模态模型在生物工程领域的实验推理能力。该基准覆盖11个主要生物工程子领域,重点突破以往评测偏重事实召回的局限,提供达到博士水平的复杂实验与前沿任务推理评估。
本文提出了Benchy,一个用于AI程序基准评测的语义规范语言与执行引擎。Benchy将基准测试形式化定义为由程序、评分函数和数据集构成的三元组B=(P,S,D),实现评测套件与被测AI系统的解耦。基准采用规范YAML编写,基于共享的任务/领域本体,可确定性编译为规范JSON中间表示并由引擎执行,为任务型AI评测提供了标准化、可复现的通用基础设施。
针对微型机器学习(TinyML)神经架构搜索计算开销巨大的难题,论文提出低保真度评估框架TGL-NSGA-II。该方法基于进化搜索仅需可靠比较候选模型优劣而非精确适应度值的洞察,利用预训练教师模型根据样本难度与类别进行分层抽样,再通过短周期的轻量知识蒸馏(KD-Lite)在压缩数据集上快速训练候选网络并排序评估,大幅降低了端侧资源受限环境下的搜索成本。
一篇arXiv预印本论文探讨了LLM智能体在模拟个体社交媒体反应时的保真度问题。研究通过问卷调查、深度访谈和书面自述对8名塞尔维亚受试者进行画像构建,记录了他们对68条社交媒体帖子的真实反应,并测试了4个语言模型预测这些反应的能力。研究指出,相比过度复杂的推理,“少思考”的直觉式提示(Intuitive Prompting)反而有助于智能体更好地契合设定画像并模拟个体社交反应。
针对现有基准测试难以反映企业实际部署复杂度的问题,研究人员提出了 HARDEN 方法。该方法利用约束进化搜索技术,在保持预期输出答案不变的前提下,沿特定领域复杂度维度对评估输入进行改造,同时严格遵循任务语义、真实性与执行有效性约束。在 FinQA、PubMedQA、ContractNLI 基准及不同规模 Qwen3.5 模型上的实验表明,该方法能有效提升评测难度并暴露模型在复杂场景下的局限性。
随着大语言模型架构在序列推荐中的广泛应用,原本用于文本处理的旋转位置编码(RoPE)也被引入。然而,NLP 中的 RoPE 仅基于 token 索引编码相对次序,无法反映推荐交互中实际流逝的时间、多尺度行为周期及日历相位。为此,研究人员提出 T-RoPE(时间感知 RoPE),将传统基于索引的相对位置替换为显式的时间维度建模,以增强生成式推荐模型捕捉用户随时间变化兴趣演进的能力。
该论文研究了音频大语言模型(Audio LLMs)在输入语音严重失真时,能否识别出自身转录结果不可靠。实验发现,如果直接通过提示词让模型评估自身转录的可靠性,模型的判断表现很差,在绝大多数情况下都会盲目自信地预测转录是可靠的,这揭示了语音交互大模型在面对低质量输入时存在自我认知盲区的问题。
大模型在推理阶段的“测试时思考”虽能提升决策逻辑,但其激增的算力成本能否转化为实际经济效益仍存疑。最新arXiv论文从经济学投入产出视角,对DeepSeek、GPT和Gemini系列模型展开了为期一年的受控交易实验。在固定信息、提示词和投资组合策略的前提下,研究通过调节推理算力预算,量化评估了扣除交易成本与推理开销后,长思考链能否真正带来更优的投资回报。
针对“系统一”单次前向决策模型(如 Laya)在面对信息缺失时倾向于盲目猜测的问题,研究人员提出了 LAVOIR(带信息价值路由的 Laya)。该方法将候选缺失信息槽位直接置于输入端与选项并列,使得模型在单次前向传播中不仅能输出决策分布,还能同时计算每个槽位对正确决策概率的预期增益,从而教会模型在何时以及主动询问何种关键信息。
研究人员提出了名为 ORCA 的综合基准测试,旨在评估大语言模型(LLM)在数据科学代码转换(DSCT)任务中的表现。数据科学代码转换涉及在不同数据科学库之间转换代码,同时保持功能等价性与跨生态互操作性。该基准包含 ORCA-MAIN 等设置,涵盖数据查询等三个代表性领域的 1600 个精选任务,填补了现有代码评测在跨库转换维度的不足。
在有限带宽预算下的生成式图像通信中,Token选择直接决定解码后的重建质量,但准确评估每个候选Token的终端价值需反复模拟接收端重建,导致编码端计算开销巨大。为此,研究团队提出ACV-Gate自适应候选评估框架,通过学习近似全预算反事实评估,并仅对最具信息量的候选Token进行精确评估,有效平衡了传输优化与计算成本。
现有生物医学语言模型虽能编码文本语义,但难以显式保留医学代码的层级结构。研究团队提出HCOE(双曲临床本体嵌入)方法,将冻结的BioBERT特征映射至庞加莱球空间,结合双向本体引导的对比学习与粗细粒度本体路径聚合,有效融合了ICD疾病代码与ATC药物分类等层级关系,提升了临床概念表征的层次感知能力。
随着实时语音智能体从研究走向实际部署,其评估标准仍割裂在语音基础模型、轮次转换心理语言学与智能体基准三个领域之间。架构论文常关注延迟,轮流对话研究关注预测准确度,而智能体基准则侧重任务成功率,缺乏统一评价体系。该论文通过梳理38篇核心文献,提出了系统性的三维评估证据链框架,旨在为实际部署的实时语音智能体提供从单点性能到落地效果的全流程评估方法。
在复杂应用场景中,大语言模型需同时兼顾多种可能相互冲突的社会规范与人类价值观。针对现有激活导向技术多针对单值且多方向直接组合采用固定干预强度、无法适应模型内部动态状态的局限,研究团队提出了 AIMES 框架。该方法通过因果激活导向技术,在推理阶段实现对多重价值观的轻量级自适应控制。注:输入论文摘要存在截断,具体实验增益与实现细节未完全展示。
研究人员提出了面向时间序列预测的 TW3Cast 系统。在 GIFT-Eval 基准评测中,该系统在 130 个方案中取得平均 MASE 排名第三的优异表现,仅次于两款基于智能体或语言模型的复杂多步骤系统。与依赖智能体的方案不同,TW3Cast 完全不使用智能体或语言模型,而是基于训练集一次性计算并冻结路由选择表,直接调度轻度微调的公开基础模型专家,在 97 种数据与预测配置下实现了极具竞争力的高效预测。
该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。
该研究探讨了强化学习在多模态大语言模型(MLLM)中抑制幻觉效果不稳定的问题,并归因于从奖励到参数更新纠错链中的两个弱点:在采样层面,高语义熵的困难查询易产生全错样本组,使最易产生幻觉区域的相对优势坍缩为零;在优化层面,高置信度的错误token存在梯度消失现象。为此,论文提出了双熵增强策略优化方法DEEPO,以改进参数更新机制并有效缓解多模态幻觉。
该研究提出了对话记忆评测基准套件 TWIST,旨在评估记忆系统在用户信念发生改变时是否能正确执行干预操作。针对现有长对话基准主要测试召回率和被动知识更新的局限,TWIST 设立了四大评估维度:主动张力检测、依据历史记录审查输出草案、在回答当前信念的同时保留历史变更记录,以及对敏感召回的治理控制。该套件基于 LoCo 进行了扩展,并引入了经人工验证的草案对齐机制。
客体永久性和固体性是人类认知的核心先验。针对视频生成模型作为代表性世界模型是否已涌现客体永久性认知这一问题,研究团队推出了WROP数据基础设施。该基准受核心认知科学启发,包含手工设计的150个任务,细分为六大认知类别,旨在探究并训练视频生成模型的物理推理能力,从而推动构建具备类人物理智能的世界模型。
该研究探讨了可验证奖励强化学习(RLVR)在开放域问答与搜索任务中的适用性。以往该方案多应用于数学和代码等奖励明确的大模型场景,10亿参数以下小模型通常依赖大模型蒸馏。研究人员采用群体相对策略优化(GRPO)算法,直接在0.8B参数的Qwen3.5小模型上测试“检索后推理”架构,探索无需教师模型蒸馏即可使端侧小型搜索智能体掌握复杂检索与推理能力的可行性。
该研究提出了一种在多任务模型中学习跨任务关系的新框架。该框架通过针对性的成对关系来近似任务标签的联合分布,从而在避免对完整联合空间建模的高昂复杂度下,利用迁移学习提升模型性能与信息抽取能力。该方法具备通用性,并在YouTube生产级推荐系统(涵盖通知、主页及“接下来播放”等场景)中完成部署验证,实验表明其显著提升了预测准确率与用户满意度。
该研究针对大语言模型作为低成本评审员在统计推断中的局限性展开探讨。研究指出,AI评估往往存在偏差和噪声,而严谨的假设检验必须明确控制第一类和第二类错误。为此,论文提出了一种人机协同的假设检验方案,结合成本感知的AI选择性评分与序贯人工核验升级机制,旨在满足严格统计推断有效性与错误率控制的前提下,最大限度降低整体评估成本。
针对蛋白质修饰中序列空间庞大且湿实验验证成本高的问题,研究人员推出了名为 PFArena 的评测基准。尽管蛋白质语言模型(PLM)、大语言模型(LLM)及智能体在蛋白质修饰领域展现出潜力,但其在实际实验决策场景中的相对表现尚不明确。PFArena 包含四个受控任务接口,覆盖单突变体生成与多突变体排序,通过提供不同梯度的突变适应度数据,系统性评估各类模型在蛋白质设计与修饰任务中的决策能力。
针对大语言模型个性化价值对齐中常采用静态画像、忽视情境对价值偏好动态影响的局限,研究人员受勒温场论启发,提出将个人价值观建模为先验、情境依赖偏好建模为后验的新范式。基于此,该研究提出了名为 BaCVA 的推理时贝叶斯情境价值对齐方法,使模型输出能够结合用户内在特质与具体环境约束,实现更动态、情境化的个性化对齐。