vLLM 分离式推理实践指南:Prefill/Decode 分离与纯 CPU 前端架构
vLLM 官方发布分离式推理(Disaggregated Serving)实战指南,详细拆解如何将 Prefill 与 Decode 阶段解耦并将分词与解析剥离至纯 CPU 前端。
推荐理由:原文系统阐述了 vLLM 分离式推理架构的实现细节与部署代码,读者可以据此评估长上下文高并发场景下的性能收益与运维权衡。
vLLM 官方发布分离式推理(Disaggregated Serving)实战指南,详细拆解如何将 Prefill 与 Decode 阶段解耦并将分词与解析剥离至纯 CPU 前端。
推荐理由:原文系统阐述了 vLLM 分离式推理架构的实现细节与部署代码,读者可以据此评估长上下文高并发场景下的性能收益与运维权衡。
Cerebras 上线智谱 GLM-4.7 推理支持并发布迁移指南,依托晶圆级集群实现最高 1500+ tokens/s 的输出速度。
推荐理由:文章总结了 GLM-4.7 的行为特性与十条工程迁移规则,读者可以直接参考这些参数设置与 Prompt 技巧优化推理效率。
OpenAI 与 Cerebras 签署多年期协议,计划从 2026 年开始分阶段部署 750 MW 的 Cerebras 晶圆级系统,用于为其客户提供低延迟 AI 推理服务。Cerebras 表示其系统运行大语言模型时的响应速度比 GPU 系统快高达 15 倍。OpenAI 称该合作旨在构建多样化的算力架构组合,为编码智能体和语音交互等实时应用提供更专用的低延迟硬件支持。
推荐理由:该协议展现了头部大模型厂商为应对大规模推理延迟与吞吐需求,开始在传统 GPU 架构之外规模化引入晶圆级专用硬件方案。
企业级低代码智能体平台 StackAI 正式接入 Cerebras 推理服务,为其合规审查、理赔与信贷决策等多步工作流提供亚秒级响应,推理速度最高比 GPU 快 15 倍。在金融、医疗及政务等高合规场景中,该集成使多步工作流延迟降低最高达 50%,高峰期吞吐稳定性提升最高 10 倍,工作流级推理成本降低 20–35%。
Cerebras 发文指出前沿大模型因参数规模扩大、长上下文普及以及推理思考 token 占比超 50% 积累了严重的延迟债务,正倒逼底层算力硬件从传统 GPU 转向专用低延迟推理架构。文章指出人机交互对超过 4 秒的延迟极度敏感,而谷歌研发 TPU、Anthropic 与 OpenAI 等大厂采购新型低延迟算力的动向表明行业正在重构推理基础设施。
OpenAI 联合 Cerebras 推出专为实时软件开发设计的 GPT-5.3-Codex-Spark 模型研究预览版,由 Cerebras 晶圆级引擎(Wafer-Scale Engine)驱动,推理速度超过 1,000 tokens/s。
推荐理由:该模型通过晶圆级芯片实现超 1000 tokens/s 推理速度,展示了定制硬件对实时交互式编程工作流的加速效果。
Cerebras 发文指出更快的推理速度已成为提升 AI 准确率的关键杠杆,能在相同延迟预算内为推理模型提供更多思考步骤。Cerebras 处理器面积是 NVIDIA B200 的 56 倍,通过将计算与片上 SRAM 紧密集成突破内存带宽瓶颈,在开源模型输出生成上实现最高达 NVIDIA GPU 15 倍的推理速度。
Cerebras 介绍了在 WSE 硬件上以超过 1,200 tokens/s 运行的 GPT-5.3-Codex-Spark 最佳编程实践。指南建议将 Spark 作为高频交互的结对编程者而非异步委托代理,通过高频测试验证、多方案快速探索以及保持单会话专注来避免代码质量退化。同时推荐将 Git 和 Markdown 文件作为持久化外部记忆,配合权限沙箱与文档自动化维护机制以降低长上下文漂移。
推荐理由:文章系统梳理了高吞吐推理下的实时结对编程方法,为开发者提供了从单任务循环到上下文管理的完整实践模式。
Cerebras 宣布 AWS 正在其数据中心部署 Cerebras CS-3 系统,后续将通过 AWS Bedrock 提供开源大语言模型与 Amazon Nova 系列的高速推理服务。
推荐理由:双方通过将Prefill与Decode解耦至不同硬件,为大吞吐量智能体编码等高速推理场景提供了新的软硬件协同方案。
Cerebras 针对 Karpathy 提出的 autoresearch 框架开展了 71 次实测,开源了 codex-autoresearch-harness 和 reap-expert-swap 工具,并总结了防止智能体自主实验偏离目标的工程实践。
推荐理由:原文通过两组真实任务实测了自主研究智能体的边界,给出了约束环境漂移和控制算力开销的具体方案。
Cerebras 发文分析指出,前沿实验室的 AI 竞争焦点正从单纯提升模型智能转向极致推理速度,token 生成速率已直接决定模型迭代与软件构建效率。OpenAI 与 Anthropic 等头部厂商均已全面使用自身的高速编码模型来自举研发下一代模型和产品代码库,Anthropic 对 2.5 倍速版本的定价更是达到基础版的 6 倍。
推荐理由:梳理了前沿大厂从卷模型智能转向卷推理速度的逻辑,有助于理解高吞吐推理对智能体研发与模型自举迭代的核心价值。
Cerebras 阐述了大模型解耦推理架构,将算力密集的 Prefill 阶段与内存带宽受限的 Decode 阶段拆分至不同硬件独立运行。
推荐理由:文章系统阐述了将大模型推理的 Prefill 与 Decode 阶段解耦运行的技术原理,展示了异构硬件协同提升吞吐与降低尾部延迟的路径。
Cerebras 与 Armis 展开合作,将超低延迟 AI 推理与 Armis Centrix™ for Application Security 平台结合,以加速漏洞检测与修复。
针对 Perplexity 宣布从 MCP 回退至 API 和 CLI 引发的争议,Cerebras 撰文分析认为两者的核心分歧在于运行时速度与安全可审计性之间的权衡。
推荐理由:文章梳理了 MCP 与 CLI 在延迟和安全上的权衡,并指出通过低延迟推理与轻量执行环境可以缓解协议带来的性能开销。
Cerebras 官方博客总结了构建多智能体工作流的实战经验,提出将单智能体拆解为“主厨(调度器)与配菜工(子智能体)”协作架构,以解决单智能体容易触碰的上下文膨胀和失败率过高问题。
推荐理由:原文通过厨房主厨与配菜工的比喻系统梳理了 5 种多智能体设计模式,读者可以据此将复杂 AI 编码任务拆解为轻量上下文并行与验证工作流。
Cerebras 宣布全面扩展其超低延迟推理生态,基于晶圆级芯片架构提供最高达传统 GPU 系统 15 倍的推理速度。平台支持主流开源代码与推理模型,提供自服务 API 与云市场采购渠道,并深度集成了 LangChain、CrewAI、Cline、Windsurf 及 LiteLLM 等涵盖智能体、编程与可观测性的开发工具链。
Cognition 选用 Cerebras 推理平台为其软件工程模型 SWE-1.6 以及 SWE-grep 子智能体提供算力支持,在 Windsurf 的 Fast 档位中实现了最高 950 tokens/s 的生成速度。
推荐理由:文章展示了模型层与硬件推理层协同优化的落地数据,读者可借此了解高速推理对编程智能体交互体验的具体提升。
Cerebras 宣布面向企业客户测试开放万亿参数开源模型 Kimi K2.6 的高速推理服务。经 Artificial Analysis 独立实测,Cerebras 运行 K2.6 的生成速度达每秒 981 个 output tokens,针对 10k 输入加 500 输出的复杂请求总耗时仅 5.6 秒,比官方接口快 29 倍。
推荐理由:原文给出了万亿参数模型在晶圆级硬件上的实测吞吐与端到端延迟对比,读者可据此评估高速推理对智能体编码工作流的提速幅度。
Cerebras 实测数据显示,运行在 Cerebras 晶圆级引擎上的 Kimi K2.6 输出速度达 981 tokens/s,为 Google Gemini 3.5 Flash(181 tokens/s)的 5.4 倍。
开启推理(测试时计算)虽能在编程与智能体基准上带来 10%–20% 的性能提升,但平均会导致 token 消耗增加 5–10 倍且耗时延长 7–11 倍。作者在分析 1000 多次智能体使用后指出,约半数日常提示词极为简单且不需要复杂思考,过长推理反而会挤占工具调用的上下文空间并增加压缩损耗。
Cerebras 深入分析了 AI Agent 自主循环机制(Loop)的演进,指出循环的核心在于引入可靠的验证器(Verifiers)而非单纯追求自主性。随着多模态视觉检查能力、MCP 等工具调用协议以及超高速推理的成熟,Agent 能够自主比对输出并低成本迭代修复;同时开发者必须设定明确的完成标准与禁止规则,以避免循环陷入死循环或投机作弊。
推荐理由:原文梳理了自主循环工作流依赖多模态验证器与高速推理的演进逻辑,为构建防失控的 Agent 提供了实践参考。
Cerebras 宣布在其推理平台上推出 Google DeepMind 开源模型 Gemma 4 31B,以超过 1,800 tokens per second(第三方测得 1,851 TPS)的吞吐运行,成为该晶圆级计算平台首个支持图像理解的多模态模型。
推荐理由:原文给出了 1,851 tokens per second 的多模态推理吞吐与首 token 延迟数据,读者可据此评估极速视觉智能体工作流的落地可行性。
Cerebras 宣布在其晶圆级芯片架构上部署 Google 最新开源多模态模型 Gemma 4 31B,推理速度达到约 2,300 tok/s,实现全流程实时交互。
推荐理由:材料通过实测对比与实操经验,展示了高推理吞吐如何将多模态模型从异步批处理转变为实时交互应用。
Cerebras 宣布与韩国 AI 公司 Upstage 合作,在 Cerebras 晶圆级引擎(Wafer-Scale Engine)上运行其 Solar 31B 模型,实现高达 2,000 tokens per second 的推理速度。
vLLM 发布投机采样训练框架 Speculators v0.5.0,引入 DFlash 块扩散算法并统一了在线与离线训练流程。DFlash 采用非因果注意力与锚点位置机制,在单次前向传播中生成整块草稿 token,在 Gemma 4 31B 评测中取得了低于 Eagle 3 的 token 间延迟。
推荐理由:材料详细介绍了单次前向传播生成草稿词的机制与训练解耦方案,为大模型推理加速与投机采样落地提供了参考路径。
vLLM 推出原生 RL API,提供标准化的权重同步接口并增强对大规模异步强化学习推理服务的支持。
推荐理由:文章系统介绍了该接口的分层设计与两阶段暂停协议,为大规模强化学习训练与推理协同提供了标准化的工程参考方案。
vLLM 官方博客解析了在基于 GB10 芯片的 NVIDIA DGX Spark 上进行本地大模型推理的架构适配与配置方案。针对 128 GB 统一内存特性,系统需要通过限制并发与预留内存来平衡系统运行,并借助 Paged KV cache 与连续批处理保证交互响应。
推荐理由:文章给出了统一内存架构下本地大模型推理的关键参数与实测数据,为桌面端算力硬件部署提供了可复现的调优参考。
vLLM 正式宣布为开源模型 NVIDIA Nemotron 3 Ultra 提供首发推理支持,支持通过 OpenAI 兼容 API 提供服务。Nemotron 3 Ultra 拥有 550B 总参数量与 55B 激活参数,采用 Transformer-Mamba 混合 MoE 架构,支持最高 1M tokens 上下文及 NVFP4 与 BF16 精度。
推荐理由:原文提供了模型规格与完整的服务启动配置,开发者可以据此在多卡集群上快速部署该长程推理模型。
传统 OCR 流水线因仅优化字符转录而缺乏结构理解,面对版面多变的收据极易导致下游自动化失效。LlamaCloud 采用基于 VLM 的统一智能体 OCR 架构,将视觉识别、版面理解、结构化推理与数值校验循环整合至单一引擎。该方案消除了繁琐的正则规则维护,可直接输出保留字段层级与行项目关系的结构化 JSON、Markdown 或 HTML 数据。
vLLM 宣布原生支持基于 Gemma4 构建的 26B 离散扩散大语言模型 DiffusionGemma,成为该框架首个原生接入的 dLLM。实现上通过 Model Runner V2 的 ModelState 抽象管理逐请求状态,复用投机解码路径与动态序列级因果注意力,支持单批次内自回归与双向去噪混合处理。
推荐理由:原文详述了利用 ModelState 抽象与投机解码路径接入扩散大模型的技术方案,为非自回归推理服务提供了工程实践参考。
vLLM 宣布首发支持 MiniMax M3 的 BF16 与 MXFP8 检查点,提供 1M token 上下文的原生多模态推理服务。该方案针对 MiniMax 稀疏注意力(MSA)设计了 128-token 粒度的分块预填充与解码算子,集成 EAGLE3 投机解码及工具与思考解析器。
推荐理由:文章给出了稀疏注意力算子实现、投机解码调优及软硬件启动参数,为百万长上下文多模态模型的低延迟上线提供了具体参考。
vLLM 在其语义路由器(vLLM-SR)中推出 Fusion 原语,支持并发调用多模型面板生成候选答案,并通过裁判模型分析共识与分歧后合成最终回复。该机制提供 vllm-sr/auto 自动路由、vllm-sr/fusion 显式调用及请求级插件覆盖三种入口,支持全链路跟踪记录与按策略容错。
推荐理由:原文给出了多模型面板协同与裁判合成的具体路由机制,为生产环境按需平衡延迟与模型组合质量提供了可落地参考。
Agentic AI 将文档处理转为推理任务,利用“计划-执行-验证”闭环在提取前理解文档结构与意图,并在提取后进行自我纠错。系统结合视觉定位与边界框感知二维空间布局,能动态推理复杂表格及多源发票等可变版式,解决传统 OCR 缺失语境和易受格式变动破坏的缺陷。例如 LlamaParse 在最终确认提取前,会确保视觉布局与语义内容相互印证。
vLLM 官方发布基于语义路由器的微智能体运行时,通过统一的 `vllm-sr/auto` API 接口在服务层内调度多模型协作。系统支持 Confidence、Ratings、ReMoM、Fusion 和 Workflows 五种协同回路模式,由路由层统一管理预算、并发上限、容错与输出协议。
推荐理由:文章把多模型协同机制下沉为开源推理服务基础设施,读者可以借此了解如何在单接口下编排多模型推理策略。
vLLM-Omni 针对 Qwen3-Omni 提出了涵盖阶段拆分、CUDA Graph、异步分块传输、异步输出与按需副本扩展的全栈在线推理优化方案。该方案将 Thinker(多模态推理)、Talker(Codec 预测)与 Code2Wav(波形重建)流水线解耦,消除了跨阶段全载荷等待与 Python 调度开销。
推荐理由:文章拆解了语音多模态模型分阶段推理的延迟瓶颈,所提出的异步流水线与阶段级扩展方案可直接迁移至同类实时全模态架构。
vLLM 联合 AMD Quark 团队推出了在 AMD Instinct GPU 上进行 EAGLE3 投机解码的训练、量化与推理完整工作流。
vLLM 宣布首发支持 Thinking Machines Lab 推出的 1T 参数原生多模态模型 TML Inkling,覆盖 NVFP4 与 BF16 两个版本,原生支持文本、图像与音频输入及最高 1M 上下文。
推荐理由:框架通过短卷积分片与通信融合等算子优化完成了万亿多模态模型适配,为超大模型长上下文推理提供了工程参考。
vLLM Semantic Router 宣布从单一请求路由演进为构建、评测和运行 Mixture-of-Models(MoM)的系统引擎,对外提供统一的模型交互接口。
推荐理由:文章阐明了将分散的独立大模型封装为统一 MoM 系统的架构设计,读者可以了解跨硬件和多模型协同调度的工程实现路径。
vLLM 宣布将为月之暗面(Moonshot AI)预计 7 月 27 日开源的 2.8T 参数模型 Kimi K3 提供 Day-0 生产级推理支持。针对 KDA 循环注意力机制,vLLM 将物理状态块大小与前缀匹配粒度解耦,实现了细粒度前缀缓存命中与写时复制。
推荐理由:文章详细拆解了针对 KDA 循环注意力与 MXFP4 MoE 的前缀缓存重构及算子优化,读者可据此了解超大混合架构在开源引擎中的工程落地细节。
DaoCloud 团队在 vLLM 官方博客分享了在 24 块 NVIDIA B300 GPU 上部署 GLM-5.2-NVFP4 的生产级优化实践,采用 4P1D 的 P/D 分离拓扑将平均 TPOT 从 40ms 降至 17ms,达成 TTFT ≤ 2.5s 与 TPOT ≤ 20ms 的 SLA 目标。
推荐理由:文章详细拆解了超大 MoE 模型在长上下文与投机解码下的端到端调优路径,给出了完整的部署配置与长周期排障经验。