vLLM 更新· khluu·· 8 天前精选AI 评分76
推理框架 vLLM 发布 v0.30.0 版本
v0.30.0
AI 导读
推理框架 vLLM 正式发布 v0.30.0 版本,新增对 DeepSeek-V4.1-Flash、GLM-5.3-Flash 等新架构模型的端到端支持。核心更新引入支持 FP4 与多机 TP 的 Fast Start 显存权重缓存守护进程,大幅缩短引擎重启与初始化耗时;同时上线 HiSparse 分层稀疏 MLA 解码机制,并深度优化了投机解码、上下文并行及 NVFP4 量化性能。
推荐理由
该版本通过显存权重常驻守护进程与稀疏解码分层卸载,为大模型长上下文与高并发推理提供了可迁移的部署优化方案。
来源:vLLM 更新 · github.com