热点事件持续更新
SoloQ扩散大语言模型免校准量化框架发布
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月7日,研究人员在 arXiv 发布了面向扩散大语言模型(dLLM)的免校准量化框架 SoloQ。该框架通过将权重和激活映射到归一化旋转基,实现了数据无关的量化处理,同时结合结构化 K-RPBH 旋转与轻量重缩放校正,支持硬件原生 NVFP4,并为块扩散模型引入提交时 KV cache 量化。测试结果表明,SoloQ 在 LLaDA、Fast-dLLM v2 等模型上能够在 4-bit 下保持精度,将峰值显存降低高达 2.61 倍,端到端推理加速可达 2.24 倍。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
SoloQ免校准量化框架发布,支持NVFP4,显存最高降2.61倍、端到端加速2.24倍。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv 机器学习SoloQ:面向扩散大语言模型的免校准量化框架
SoloQ 是一种面向扩散大语言模型(dLLM)的免校准量化框架,通过将权重和激活映射到归一化旋转基实现数据无关量化。该方案结合结构化 K-RPBH 旋转与轻量重缩放校正,支持硬件原生 NVFP4,并为块扩散模型引入提交时 KV cache 量化。在 LLaDA、Fast-dLLM v2 等模型上,SoloQ 在 4-bit 下保持精度,峰值显存降低高达 2.61X,端到端推理加速达 2.24X。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。