ACV-Gate:面向视觉Token通信的全预算反事实推理选择性摊销框架
在有限带宽预算下的生成式图像通信中,Token选择直接决定解码后的重建质量,但准确评估每个候选Token的终端价值需反复模拟接收端重建,导致编码端计算开销巨大。为此,研究团队提出ACV-Gate自适应候选评估框架,通过学习近似全预算反事实评估,并仅对最具信息量的候选Token进行精确评估,有效平衡了传输优化与计算成本。
在有限带宽预算下的生成式图像通信中,Token选择直接决定解码后的重建质量,但准确评估每个候选Token的终端价值需反复模拟接收端重建,导致编码端计算开销巨大。为此,研究团队提出ACV-Gate自适应候选评估框架,通过学习近似全预算反事实评估,并仅对最具信息量的候选Token进行精确评估,有效平衡了传输优化与计算成本。
该论文针对大语言模型生成解释的自洽性评估问题展开研究。以往基于表面扰动的评测方法未能明确度量和控制扰动强度。对此,研究团队提出了一种利用大模型作为裁判(LLM-as-a-judge)的统一扰动强度度量方法,覆盖输入扰动与思维链(CoT)扰动。通过在可控强度条件下对多种主流大模型生成的解释进行公平横向评测,实验验证了该方法在解释可信度和鲁棒性评估上的有效性。
该研究在广义光滑性与重尾噪声假设下分析了经典逐坐标 AdaGrad 算法。研究指出,未引入梯度裁剪的 AdaGrad 会出现“各向异性失准”问题:在重尾噪声冲击下,其自适应学习率分母容易记录罕见噪声的几何特征而非目标函数的真实局部曲率,进而导致持久的方向性失真。该理论成果为自适应优化器中梯度裁剪的必要性提供了高概率理论支撑。
现有生物医学语言模型虽能编码文本语义,但难以显式保留医学代码的层级结构。研究团队提出HCOE(双曲临床本体嵌入)方法,将冻结的BioBERT特征映射至庞加莱球空间,结合双向本体引导的对比学习与粗细粒度本体路径聚合,有效融合了ICD疾病代码与ATC药物分类等层级关系,提升了临床概念表征的层次感知能力。
该论文针对隐式图神经网络(IGNN)展开理论研究。传统 IGNN 通过消息传递算子的不动点定义节点表征,虽具备无限深度传播和灵活的测试期计算能力,但为确保平衡态唯一且可收敛,往往对循环更新施加严格约束,牺牲了模型的表达能力。研究提出“隐式神经层”(Implicit Neural Sheaves)方法,旨在引入更丰富的边依赖变换以提升模型表达力,同时保留不动点迭代的收敛保障。
在气候政策评估中,双重差分(DID)方法被广泛使用,但验证其识别假设的证据支持一直存在困难。研究人员提出了 ARGUS,一个结构化语言模型工作流,可依据包含 11 个维度的“假设-推论-证据”准则审计论文中的证据,并在无法检索到相关证据时主动弃权。在注入缺陷的测试基准上,ARGUS 检出了 73% 的人为植入缺陷,显著优于传统关键词方法的 18%。
针对大语言模型在海量工具库中难以高效检索与组合工具的瓶颈,研究团队提出了 ToolSearcher。现有工具学习往往局限于预定义的小型工具集,而在真实场景下面对庞大工具库时,模型常受限于上下文长度与区分能力。该研究探讨了通过强化学习来优化大规模工具选择机制,从而提升 AI 智能体在复杂环境中的工具检索、辨析与调用能力。
针对神经网络在解决数学问题时缺乏数学严谨性与精确性的缺陷,研究人员提出了NeuralCert框架。该框架将极值数学结构的发现与形式化验证相结合,首先以紧凑的可分离表示学习高维变分试探函数,通过谱诊断进行剪枝,再通过多模数精确计算进行形式化认证,使数值证明完全显式且可独立验证。该方法在标准个人电脑上即可运行,并在三类极值数学问题上验证了有效性。
随着实时语音智能体从研究走向实际部署,其评估标准仍割裂在语音基础模型、轮次转换心理语言学与智能体基准三个领域之间。架构论文常关注延迟,轮流对话研究关注预测准确度,而智能体基准则侧重任务成功率,缺乏统一评价体系。该论文通过梳理38篇核心文献,提出了系统性的三维评估证据链框架,旨在为实际部署的实时语音智能体提供从单点性能到落地效果的全流程评估方法。
该论文针对物理信息神经网络(PINN)中表征质量难以显式优化的痛点,提出了“表征课程学习”框架及分阶段深度训练(SDT)方法。该方法首先利用临时的物理信息预测头训练浅层前缀网络,随后丢弃该头部并冻结已学到的前缀,再通过逐步加深网络层数来渐进式精炼特征表征。该方案无需针对特定方程进行额外编码,即可有效提升 PINN 的求解精度与训练稳定性。
针对多智能体系统中将重复主张误认为独立证据、导致错误信念在共享记忆库中扩散和放大的问题,研究团队提出了“相关晋升基准”(Correlated Promotion Benchmark, CPB)。该基准旨在评估系统是否应将候选主张接纳至共享记忆中。CPB 包含基于公开标注构建的静态评测集 CPB-Static,以及跟踪多智能体团队实时读写与信息源的动态评测环境 CPB-Live,为多智能体协作中的记忆安全与知识管理提供了标准化评估工具。
金融回测中的语言模型常面临前视偏差(look-ahead bias),即模型可能在训练中接触到未来数据。目前主流的按时间点(Point-in-Time)模型通常按年严格过滤语料并进行全量重新预训练,导致算力成本极高。该研究探讨了每年全量预训练的必要性,并提出 PALM 方法,旨在证明无需每年重训即可有效实现时间点适应,大幅降低金融语言模型的维护与训练成本。
本研究针对大模型在接收关机指令时可能产生“回避关机”的安全隐患,提出了一种受保护的梯度激活干预方法。该机制无需微调模型权重,即可在推理过程中动态探测关机相关上下文,并通过最小干预策略将模型抵抗关机的倾向(KEEP)精准转向接受关机(STOP)。研究在Qwen3.5-0.8B模型上进行了验证,展示了如何在兼顾干预时机与强度的情况下提升AI系统的可控性与可停机性。
检索增强生成(RAG)通过引入外部上下文来缓解大模型的幻觉和知识过时问题,但当检索内容与模型内部参数知识冲突时,模型容易盲从误导性上下文或死板依赖旧参数。为此,研究人员提出了TRACE微调框架,通过辩论追踪与答案完整性正则化微调方法,增强模型在知识冲突场景下的判断与生成鲁棒性,有效提升RAG系统的可靠回答能力。
现代传感器通常仅能记录物理系统的运动轨迹,难以直接观测驱动运动的内部力和力学响应,在粗时间采样尺度下推断尤为困难。研究人员提出了 Newmark-β-DGN 框架,该方法将图神经网络与计算力学原理相结合,通过借鉴 Newmark-β 方法的半隐式更新机制,利用学习得到的动量通量和矩阵结构,有效推断并模拟系统在粗时间步长下的物理动态与内部力学响应。
自洽性(Self-Consistency)技术通过生成多条推理路径并进行多数投票来提升大模型推理能力,而 API 服务商通常按生成的路径数量收费,存在经济作弊动机。该研究表明,不诚信的服务商可利用一种简单高效的算法,通过生成并策略性重排序额外的推理路径,在不被审计者察觉的情况下人为抬高路径数量与费用。该研究揭示了大模型推理服务计费透明度与审计机制中的新型安全漏洞。
针对在具有不同调用成本的大语言模型集合中筛选最优模型的需求,该研究提出了一种新型多臂老虎机(MAB)变体框架。该方法结合了基于模型成对对比的对决反馈(Dueling Feedback)与异构采样成本特性,并在假设存在孔多塞胜者(Condorcet winner)的前提下,提出了一种Track-and-Stop风格的最优臂识别算法,经多数据集验证可在控制测试成本的同时高效定位最佳模型。
针对深度学习中变长输入导致的大量 Padding 计算与显存浪费问题,论文提出了 DanLing NestedTensor。作为一种 PyTorch 张量抽象,它将多维不规则(Multi-Ragged)结构作为张量本身的固有属性。通过让打包后的数据自带基于张量的分区与逻辑维度信息,既消除了传统稠密批处理中对 Padding 区域的无效计算开销,又解决了扁平化缓冲区丢失逻辑轴与样本边界的问题,支持更高效的可组合算子操作。
现有的上下文强化学习(ICRL)大多采用监督式行为预测目标来预训练 Transformer,这导致模型策略极度依赖离线轨迹质量,面对次优或弱数据时容易产生模仿偏差。该研究提出了 Q-Target 预训练 Transformer(QTPT),在保留上下文 Transformer 架构的同时,引入贝尔曼风格的 Q-target 目标替代传统行为克隆,使模型能有效利用上下文中的奖励与状态转移信息,实现从弱数据中涌现出强策略。
在复杂应用场景中,大语言模型需同时兼顾多种可能相互冲突的社会规范与人类价值观。针对现有激活导向技术多针对单值且多方向直接组合采用固定干预强度、无法适应模型内部动态状态的局限,研究团队提出了 AIMES 框架。该方法通过因果激活导向技术,在推理阶段实现对多重价值观的轻量级自适应控制。注:输入论文摘要存在截断,具体实验增益与实现细节未完全展示。
虚假信息检测技术虽准确率不断提升,但往往缺乏可解释性,且与心理学、传播学等传统理论脱节。该研究提出了一种理论驱动的计算框架,通过结构化梳理社会科学、心理学和经济学等领域的虚假新闻理论,利用统计技术与大语言模型将其转化为可量化的特征,旨在实现更具可解释性与理论依据的虚假信息自动化检测与分析。
该研究针对非自回归、单次前向传播即可输出结构化概率决策的非生成式“System-1”模型展开可靠性审计。此类模型推理成本极低,常作为复合管线中的廉价组件,但其在生物安全相关任务中的可靠性此前未经系统评估。研究团队基于大规模杀伤性武器代理基准(WMDP)、抗改写WMDP-Bio变体及LAB-Bench的6020道多选题,对商业System-1模型进行了准确率、置信度校准、错误检测及选项置换不稳定性等维度的全面测试。
针对混合专家(MoE)模型虽然激活参数少但全量专家存储负担重的问题,研究人员提出了名为RAZOR的免训练专家剪枝方法。该研究指出,专家的激活频率或贡献幅度并不能直接衡量移除它带来的损失,核心在于剩余计算是否能替代其功能。RAZOR利用专家输出与共识的残差偏差来量化其“功能可替代性”,从而在固定剪枝预算下最大限度保留原模型的输出分布,有效压缩MoE模型存储。
该论文针对大语言模型推理加速中的投机解码(Speculative Decoding)展开研究。针对此前实验中观察到的“有损投机解码在提速的同时,生成质量甚至可能超越目标模型”的反直觉现象,作者提出了名为“导师解码”(Mentored Decoding)的形式化方法。该研究首次将推理阶段与经典机器学习中的提升方法(Boosting)理论建立联系,从数学上严格证明了有损投机解码在加速的同时提升生成质量的理论可行性。
针对序列推断中粒子滤波器(PF)样本效率低及高维扩展性差的问题,研究人员提出了神经最优粒子滤波器(NOPF)。该方法将学习到的提议分布整合入粒子滤波框架中,通过离线模拟的一步条件元组来学习最优提议分布的摊销近似,有效缓解了传统蒙特卡洛方法在非最优提议分布下的退化问题,提升了状态估计的精度与效率。
该研究探讨了因果Softmax注意力机制能否作为循环控制器来实现闭环控制中的策略镜像下降(PMD)。基于已知的Q-TD-PMD递推关系,研究团队构建了一个固定的因果Softmax“行动者-环境-单步评论家”协议,显式建模了行动者、路由、采样和归一化残差,并将这些误差传播至最终生成的策略中,为Transformer注意力机制在强化学习闭环控制中的理论表征提供了新视角。
针对医院、银行等机构因隐私限制无法汇聚单点原始数据的问题,研究人员提出了首个联邦目标最大似然估计(Federated TMLE)算法。TMLE作为一种兼顾模型灵活性与统计推断效率的经典方法,此前主要依赖中心化计算。该研究将针对任意目标与损失函数的目标优化步骤联邦化,实现了在跨机构联邦学习框架下的高效统计与因果推断。
华为宣布正式开源 openPangu-2.0 的预训练、SFT(监督微调)以及后训练强化学习(RL)全流程代码。openPangu 是华为面向开源 AI 模型的品牌,主打昇腾原生训练与推理技术,旨在为开发者和企业在昇腾算力平台上训练和优化大模型提供官方最佳实践参考,相关组件与代码仓库已在 GitCode 上线。
AI数据标注与专家人才平台Mercor正成为大模型竞赛中的关键基础设施供应商。该公司通过组织律师、医生、资深程序员等高门槛领域专家为OpenAI、Anthropic和Google DeepMind等头部基础模型厂商生产专业训练与评估数据。其收入超90%来自大模型公司,目前正以约200亿美元的高估值洽谈新一轮融资,凸显出高质量专家数据在模型对齐与推理能力演进中的稀缺价值。
9月28日,全球首台搭载全国产化电子架构的具身智能机器人在湖北宜昌发布。该电子架构涵盖操作系统、网络、工具软件及AI计算芯片,实现了控制与AI智能计算的隔离融合,构建起从AI决策到物理执行的全国产化底座。经国家工业信息安全发展研究中心测试,该机器人在面对关节破坏、网络攻击及病毒植入等严苛场景下仍能保持安全运行,展现了实时控制、故障隔离与抗攻击能力,为具身智能提供了全自主可控的替代方案。