HybridInfer:面向端、边、云协同大模型推理的热感知强化学习分层路由
该研究探讨了端侧小模型在连续推理时面临的硬件限制。作者在旗舰骁龙设备上发现,端侧持续生成不仅会导致降温降频,还因现有工具链(移动GPU上的OpenCL内核编译与长Prompt预填充)缺陷,导致GPU运行时在连续查询后崩溃或静默卡死。为此,研究提出了HybridInfer,采用热感知的强化学习策略,在端侧、边缘和云端之间进行动态分层路由,以兼顾本地隐私、成本与系统稳定性。
该研究探讨了端侧小模型在连续推理时面临的硬件限制。作者在旗舰骁龙设备上发现,端侧持续生成不仅会导致降温降频,还因现有工具链(移动GPU上的OpenCL内核编译与长Prompt预填充)缺陷,导致GPU运行时在连续查询后崩溃或静默卡死。为此,研究提出了HybridInfer,采用热感知的强化学习策略,在端侧、边缘和云端之间进行动态分层路由,以兼顾本地隐私、成本与系统稳定性。
该研究针对自适应优化器中二阶矩估计的预条件指数展开探索。现有部分自适应方法通常研究动量更新与标准Adam平方根之间的指数设定,但该指数与全局学习率之间的耦合作用尚不明确。研究人员构建了包含稳定稀疏特征、环境相关伪稀疏特征、密集特征及高维噪声的四环境分类控制实验,覆盖21种预条件指数配置,系统分析了非常规负指数对跨环境泛化能力的影响。
研究人员提出了ENAS,一种面向超低功耗微控制器(TinyML)的硬件感知神经架构搜索框架。该框架结合了静态可行性检查、支持多种卷积块的基于单元搜索空间,以及“随机-Top-K-变异”的三阶段混合搜索策略与跨运行缓存。与依赖GPU加速的传统NAS不同,ENAS无需GPU即可高效运行,显著降低了端侧AI开发的算力门槛。
该研究探讨了如何利用固定随机实验(A/B 测试)的历史数据来辅助部署基于上下文老虎机(Contextual Bandits)的自适应实验。研究提出将离线策略评估(OPE)与受控热启动模拟相结合的方法,从存在异质性处理效应的 A/B 测试日志数据中估计干扰成分,并利用双重稳健估计器对候选自适应策略进行排序与评估,从而判断自适应策略在何种条件下优于原始静态实验设计。
该研究针对AI安全与可解释性领域的一种常见做法提出质疑:研究人员常在全精度权重上校准可解释性特征,并部署于量化模型,随后仅凭未报告底噪的尺度不变统计量(如余弦相似度、相关系数等)便宣称特征成功迁移。论文以均值差方向估计器为例,推导了由无量纲数决定的底噪基准,揭示了忽略噪声基准会导致对可解释性在量化模型中有效性的误判。
该研究在广义光滑性与重尾噪声假设下分析了经典逐坐标 AdaGrad 算法。研究指出,未引入梯度裁剪的 AdaGrad 会出现“各向异性失准”问题:在重尾噪声冲击下,其自适应学习率分母容易记录罕见噪声的几何特征而非目标函数的真实局部曲率,进而导致持久的方向性失真。该理论成果为自适应优化器中梯度裁剪的必要性提供了高概率理论支撑。
该论文针对隐式图神经网络(IGNN)展开理论研究。传统 IGNN 通过消息传递算子的不动点定义节点表征,虽具备无限深度传播和灵活的测试期计算能力,但为确保平衡态唯一且可收敛,往往对循环更新施加严格约束,牺牲了模型的表达能力。研究提出“隐式神经层”(Implicit Neural Sheaves)方法,旨在引入更丰富的边依赖变换以提升模型表达力,同时保留不动点迭代的收敛保障。
针对神经网络在解决数学问题时缺乏数学严谨性与精确性的缺陷,研究人员提出了NeuralCert框架。该框架将极值数学结构的发现与形式化验证相结合,首先以紧凑的可分离表示学习高维变分试探函数,通过谱诊断进行剪枝,再通过多模数精确计算进行形式化认证,使数值证明完全显式且可独立验证。该方法在标准个人电脑上即可运行,并在三类极值数学问题上验证了有效性。
该论文针对物理信息神经网络(PINN)中表征质量难以显式优化的痛点,提出了“表征课程学习”框架及分阶段深度训练(SDT)方法。该方法首先利用临时的物理信息预测头训练浅层前缀网络,随后丢弃该头部并冻结已学到的前缀,再通过逐步加深网络层数来渐进式精炼特征表征。该方案无需针对特定方程进行额外编码,即可有效提升 PINN 的求解精度与训练稳定性。
金融回测中的语言模型常面临前视偏差(look-ahead bias),即模型可能在训练中接触到未来数据。目前主流的按时间点(Point-in-Time)模型通常按年严格过滤语料并进行全量重新预训练,导致算力成本极高。该研究探讨了每年全量预训练的必要性,并提出 PALM 方法,旨在证明无需每年重训即可有效实现时间点适应,大幅降低金融语言模型的维护与训练成本。
本研究针对大模型在接收关机指令时可能产生“回避关机”的安全隐患,提出了一种受保护的梯度激活干预方法。该机制无需微调模型权重,即可在推理过程中动态探测关机相关上下文,并通过最小干预策略将模型抵抗关机的倾向(KEEP)精准转向接受关机(STOP)。研究在Qwen3.5-0.8B模型上进行了验证,展示了如何在兼顾干预时机与强度的情况下提升AI系统的可控性与可停机性。
检索增强生成(RAG)通过引入外部上下文来缓解大模型的幻觉和知识过时问题,但当检索内容与模型内部参数知识冲突时,模型容易盲从误导性上下文或死板依赖旧参数。为此,研究人员提出了TRACE微调框架,通过辩论追踪与答案完整性正则化微调方法,增强模型在知识冲突场景下的判断与生成鲁棒性,有效提升RAG系统的可靠回答能力。
现代传感器通常仅能记录物理系统的运动轨迹,难以直接观测驱动运动的内部力和力学响应,在粗时间采样尺度下推断尤为困难。研究人员提出了 Newmark-β-DGN 框架,该方法将图神经网络与计算力学原理相结合,通过借鉴 Newmark-β 方法的半隐式更新机制,利用学习得到的动量通量和矩阵结构,有效推断并模拟系统在粗时间步长下的物理动态与内部力学响应。
自洽性(Self-Consistency)技术通过生成多条推理路径并进行多数投票来提升大模型推理能力,而 API 服务商通常按生成的路径数量收费,存在经济作弊动机。该研究表明,不诚信的服务商可利用一种简单高效的算法,通过生成并策略性重排序额外的推理路径,在不被审计者察觉的情况下人为抬高路径数量与费用。该研究揭示了大模型推理服务计费透明度与审计机制中的新型安全漏洞。
针对在具有不同调用成本的大语言模型集合中筛选最优模型的需求,该研究提出了一种新型多臂老虎机(MAB)变体框架。该方法结合了基于模型成对对比的对决反馈(Dueling Feedback)与异构采样成本特性,并在假设存在孔多塞胜者(Condorcet winner)的前提下,提出了一种Track-and-Stop风格的最优臂识别算法,经多数据集验证可在控制测试成本的同时高效定位最佳模型。
针对深度学习中变长输入导致的大量 Padding 计算与显存浪费问题,论文提出了 DanLing NestedTensor。作为一种 PyTorch 张量抽象,它将多维不规则(Multi-Ragged)结构作为张量本身的固有属性。通过让打包后的数据自带基于张量的分区与逻辑维度信息,既消除了传统稠密批处理中对 Padding 区域的无效计算开销,又解决了扁平化缓冲区丢失逻辑轴与样本边界的问题,支持更高效的可组合算子操作。
现有的上下文强化学习(ICRL)大多采用监督式行为预测目标来预训练 Transformer,这导致模型策略极度依赖离线轨迹质量,面对次优或弱数据时容易产生模仿偏差。该研究提出了 Q-Target 预训练 Transformer(QTPT),在保留上下文 Transformer 架构的同时,引入贝尔曼风格的 Q-target 目标替代传统行为克隆,使模型能有效利用上下文中的奖励与状态转移信息,实现从弱数据中涌现出强策略。
在复杂应用场景中,大语言模型需同时兼顾多种可能相互冲突的社会规范与人类价值观。针对现有激活导向技术多针对单值且多方向直接组合采用固定干预强度、无法适应模型内部动态状态的局限,研究团队提出了 AIMES 框架。该方法通过因果激活导向技术,在推理阶段实现对多重价值观的轻量级自适应控制。注:输入论文摘要存在截断,具体实验增益与实现细节未完全展示。
虚假信息检测技术虽准确率不断提升,但往往缺乏可解释性,且与心理学、传播学等传统理论脱节。该研究提出了一种理论驱动的计算框架,通过结构化梳理社会科学、心理学和经济学等领域的虚假新闻理论,利用统计技术与大语言模型将其转化为可量化的特征,旨在实现更具可解释性与理论依据的虚假信息自动化检测与分析。
该研究针对非自回归、单次前向传播即可输出结构化概率决策的非生成式“System-1”模型展开可靠性审计。此类模型推理成本极低,常作为复合管线中的廉价组件,但其在生物安全相关任务中的可靠性此前未经系统评估。研究团队基于大规模杀伤性武器代理基准(WMDP)、抗改写WMDP-Bio变体及LAB-Bench的6020道多选题,对商业System-1模型进行了准确率、置信度校准、错误检测及选项置换不稳定性等维度的全面测试。
针对混合专家(MoE)模型虽然激活参数少但全量专家存储负担重的问题,研究人员提出了名为RAZOR的免训练专家剪枝方法。该研究指出,专家的激活频率或贡献幅度并不能直接衡量移除它带来的损失,核心在于剩余计算是否能替代其功能。RAZOR利用专家输出与共识的残差偏差来量化其“功能可替代性”,从而在固定剪枝预算下最大限度保留原模型的输出分布,有效压缩MoE模型存储。
该论文针对大语言模型推理加速中的投机解码(Speculative Decoding)展开研究。针对此前实验中观察到的“有损投机解码在提速的同时,生成质量甚至可能超越目标模型”的反直觉现象,作者提出了名为“导师解码”(Mentored Decoding)的形式化方法。该研究首次将推理阶段与经典机器学习中的提升方法(Boosting)理论建立联系,从数学上严格证明了有损投机解码在加速的同时提升生成质量的理论可行性。
针对序列推断中粒子滤波器(PF)样本效率低及高维扩展性差的问题,研究人员提出了神经最优粒子滤波器(NOPF)。该方法将学习到的提议分布整合入粒子滤波框架中,通过离线模拟的一步条件元组来学习最优提议分布的摊销近似,有效缓解了传统蒙特卡洛方法在非最优提议分布下的退化问题,提升了状态估计的精度与效率。
该研究探讨了因果Softmax注意力机制能否作为循环控制器来实现闭环控制中的策略镜像下降(PMD)。基于已知的Q-TD-PMD递推关系,研究团队构建了一个固定的因果Softmax“行动者-环境-单步评论家”协议,显式建模了行动者、路由、采样和归一化残差,并将这些误差传播至最终生成的策略中,为Transformer注意力机制在强化学习闭环控制中的理论表征提供了新视角。
针对医院、银行等机构因隐私限制无法汇聚单点原始数据的问题,研究人员提出了首个联邦目标最大似然估计(Federated TMLE)算法。TMLE作为一种兼顾模型灵活性与统计推断效率的经典方法,此前主要依赖中心化计算。该研究将针对任意目标与损失函数的目标优化步骤联邦化,实现了在跨机构联邦学习框架下的高效统计与因果推断。
该研究针对知识追踪(KT)模型黑盒预测导致难以有效指导教学实践的问题,提出了一套综合验证协议。该协议系统评估了模型的预测竞争力、解释稳定性以及基于重新训练的忠实度。研究基于ASSISTments 2009和2012数据集,围绕五个教学主题构建了13个行为特征,并修正重建了原始数据集中存在技能构建重复记录的问题,为教育AI模型的可解释性评估提供了更可靠的基准。
针对药物研发中毒性预测面临的样本严重失衡、骨架泛化差以及缺乏临床可解释性等难题,研究人员提出了多模态网络架构 SMILESGNN。该模型通过交叉注意力机制,融合了 SMILES Transformer 编码器与 GATv2 图编码器,弥补了单一序列模型无法提供图归因解释的缺陷。此外,研究还推出了预训练变体 SMILESGNN-PT,有效提升了分子表征的泛化性能与临床解释能力。
针对压气机叶栅开式叶尖间隙流中CFD预测与实验存在偏差且高分辨率实验真值缺失的问题,该研究提出一种基于变分自编码器(VAE)与潜在空间自适应的非侵入式修正方法。研究首先使用166个参数化采样的CFD总压损失场数据集训练VAE以获取流场的低维统计表征,随后冻结该VAE,并利用少量数据训练低秩潜在空间适配器进行流场修正(注:原摘要末尾不完整)。
该研究针对扩散模型中表征正则化方法常忽视内置条件(如标签或文本)影响的问题,揭示了条件信号对特征分布的作用机制,并提出了 CARE(条件感知表征正则化)框架。CARE 是一种轻量级且即插即用的正则化方案,能够根据条件相似性动态调整特征分布,从而进一步优化扩散模型的样本生成质量并提升训练效率。
空间转录组学能够描绘组织结构内的基因表达,但高昂的成本限制了其日常应用。利用常见的HE病理图像预测空间基因表达是一种可扩展的替代方案,但传统方法通常将高维基因输出视为独立目标,忽略了基因间的生物学协同作用,且极易受高维噪声影响而发生过拟合。为此,该研究提出了轻量级模型SpaFactor,旨在摆脱对高开销图网络或复杂辅助组件的依赖,实现高效的空间上下文感知基因程序建模。