苹果提出隐空间蒸馏技术:压缩端侧流式神经音频编码器
苹果系统级听写功能完全在设备端运行,音频需通过编码器分词后输入基础模型。针对端侧常驻分词器与稀疏激活模型争抢 DRAM 内存、影响功耗和延迟的问题,研究团队提出了基于隐空间蒸馏的流式神经音频编码器压缩方法,有效降低了编码器参数量与计算开销,提升了端侧语音识别的资源利用效率。
苹果系统级听写功能完全在设备端运行,音频需通过编码器分词后输入基础模型。针对端侧常驻分词器与稀疏激活模型争抢 DRAM 内存、影响功耗和延迟的问题,研究团队提出了基于隐空间蒸馏的流式神经音频编码器压缩方法,有效降低了编码器参数量与计算开销,提升了端侧语音识别的资源利用效率。
离散流匹配在文本生成中通常需要数百次前向计算,而传统蒸馏旨在用少量步数复现该轨迹。该研究指出,少步数蒸馏效果不佳的瓶颈并非学生模型容量不足,而是教师轨迹本身存在缺陷——无序的随机跳转使得早期中继点的错误不断向后传播。为此,研究团队提出以轨迹质量为核心,结合能量导航机制指导蒸馏过程,显著提升了少步数离散流匹配文本生成的效率与质量。