vLLM 官方博客(网页)·· 22 小时前精选AI 评分78
vLLM 推出 vllm-metal:支持 Apple Silicon 的并发推理服务栈
Announcing vllm-metal: Concurrent Serving on Apple SiliconSep 22, 2026·10 min readvllm-metal brings vLLM's paged, continuously batched serving stack to Apple Silicon, with flatter TTFT under concurrent agent load, batched MTP, and automatic M5 prefill acceleration.
AI 导读
vLLM 官方发布 vllm-metal,将 vLLM 的 V1 调度器、分页 KV 缓存和连续批处理服务栈引入 Apple Silicon,底层结合 MLX 与 Metal 执行。
推荐理由
原文给出了将 vLLM 分页调度栈移植到 Apple Silicon 的架构与内核实现,读者可以据此评估 Mac 本地多智能体并发推理的性能与部署方案。
来源:vLLM 官方博客(网页) · vllm.ai