苹果提出隐空间蒸馏技术:压缩端侧流式神经音频编码器
苹果系统级听写功能完全在设备端运行,音频需通过编码器分词后输入基础模型。针对端侧常驻分词器与稀疏激活模型争抢 DRAM 内存、影响功耗和延迟的问题,研究团队提出了基于隐空间蒸馏的流式神经音频编码器压缩方法,有效降低了编码器参数量与计算开销,提升了端侧语音识别的资源利用效率。
苹果系统级听写功能完全在设备端运行,音频需通过编码器分词后输入基础模型。针对端侧常驻分词器与稀疏激活模型争抢 DRAM 内存、影响功耗和延迟的问题,研究团队提出了基于隐空间蒸馏的流式神经音频编码器压缩方法,有效降低了编码器参数量与计算开销,提升了端侧语音识别的资源利用效率。
该研究针对半监督联邦学习(SSFL)在自动语音识别(ASR)场景中极易发散的技术痛点提出改进方案。在客户端仅有未标注数据的情况下,ASR 伪标签错误会在输出序列与多轮训练中复合累积,导致模型性能大幅落后于全监督联邦学习。研究表明,弥合这一差距的关键在于两个耦合的设计维度:一是优化生成在线伪标签的教师模型机制,二是利用服务端少量标注数据进行更新以构建稳定训练的“锚点”,有效抑制了误差累积。
该研究提出了一种名为探针引导(probe guidance)的新方法,用于引导流匹配(flow matching)模型。该方法利用现有扩散模型冻结的内部状态来构建引导信号,原理类似自动引导(autoguidance),但消除了推理时额外的模型前向传播开销,并确保弱模型与强模型具有一致的动力学特性。在连续扩散语言模型上的基准测试表明,该方法在无条件生成任务上刷新了 SOTA 性能表现。
激活转向是引导生成模型行为(如降低毒性)的重要技术,但传统方法通常对所有输入采用统一干预,容易在无需转向的场景下损害模型原有性能。研究人员提出了动态缩放激活转向(DSAS)框架,将“何时干预”与“如何干预”解耦。DSAS能够跨层并根据具体输入自适应调整现有转向变换的强度,仅在检测到不良行为时进行强干预,从而在保障对齐控制的同时最大程度保留模型基础能力。
自主强化学习的核心目标是摆脱外部重置实现持续策略训练,但现有范式大多依赖环境的可逆性假设,这在现实物理操作(如物体掉落或粉末洒出等不可逆事件)中并不成立。研究团队推出了 REVERSAL-BENCH 基准,通过连续参数控制可逆性程度,并提供真实状态可恢复性验证机制(Reset Oracle),覆盖5个物理引擎中的8种操作场景,用于系统评估强化学习在不可逆环境下的性能断崖问题。
针对基于大模型的多轮工具调用智能体在会话间上下文丢失、以及全量持久化历史导致 Token 浪费和生成质量下降的问题,研究提出了一种“共享选择性持久记忆”架构。该方案通过识别并保留任务规范、数据 Schema 等四类高价值可复用上下文,实现了跨会话的经验沉淀与高效检索,在降低上下文冗余的同时提升了多轮代码生成等场景的执行效率与准确率。
针对企业数据湖中数据表增长过快、人工难以维护列描述和数据治理标签的痛点,该研究提出了生产级系统 Glyph。该系统将列描述生成与敏感数据类型标注两项任务,建模为基于有状态图编排的协作型大模型智能体。其中,描述生成器通过按需检索生成各数据列的数据管道源代码作为上下文依据,实现精准的元数据自动化补齐与合规标签标注,有效解决数据治理负债问题。
扩散大语言模型作为自回归模型的替代方案备受关注,但现有强化学习方法通常将所有去噪步视为同等重要,且依赖高方差、有偏的似然估计。为此,研究团队提出 DACA-GRPO(去噪感知信用分配 GRPO)。该方法作为一种轻量级、即插即用的增强方案,解决了去噪轨迹中时间信用分配缺失及策略优化时平均场似然估计的系统性偏差问题,提升了扩散语言模型的强化学习训练效果。
离散流匹配在文本生成中通常需要数百次前向计算,而传统蒸馏旨在用少量步数复现该轨迹。该研究指出,少步数蒸馏效果不佳的瓶颈并非学生模型容量不足,而是教师轨迹本身存在缺陷——无序的随机跳转使得早期中继点的错误不断向后传播。为此,研究团队提出以轨迹质量为核心,结合能量导航机制指导蒸馏过程,显著提升了少步数离散流匹配文本生成的效率与质量。
对话大模型在后训练阶段常被注入好奇心、同理心以及“有用、无害、诚实”等特定价值观与行为特征,以提升安全性与交互体验。然而,各项价值观念复杂交织,诱导或强化某一价值观可能意外改变模型在其他维度的表现。研究指出,不当的价值注入可能导致模型生成更具成瘾性或谄媚(sycophancy)倾向的语言,进而对用户产生潜在负面影响,揭示了后训练价值对齐的复杂性与副作用。