vLLM Semantic Router 升级架构:从智能路由演进为 Mixture-of-Models 系统引擎
vLLM Semantic Router 宣布从单一请求路由演进为构建、评测和运行 Mixture-of-Models(MoM)的系统引擎,对外提供统一的模型交互接口。
推荐理由:文章阐明了将分散的独立大模型封装为统一 MoM 系统的架构设计,读者可以了解跨硬件和多模型协同调度的工程实现路径。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
vLLM Semantic Router 宣布从单一请求路由演进为构建、评测和运行 Mixture-of-Models(MoM)的系统引擎,对外提供统一的模型交互接口。
推荐理由:文章阐明了将分散的独立大模型封装为统一 MoM 系统的架构设计,读者可以了解跨硬件和多模型协同调度的工程实现路径。
vLLM 宣布将为月之暗面(Moonshot AI)预计 7 月 27 日开源的 2.8T 参数模型 Kimi K3 提供 Day-0 生产级推理支持。针对 KDA 循环注意力机制,vLLM 将物理状态块大小与前缀匹配粒度解耦,实现了细粒度前缀缓存命中与写时复制。
推荐理由:文章详细拆解了针对 KDA 循环注意力与 MXFP4 MoE 的前缀缓存重构及算子优化,读者可据此了解超大混合架构在开源引擎中的工程落地细节。
DaoCloud 团队在 vLLM 官方博客分享了在 24 块 NVIDIA B300 GPU 上部署 GLM-5.2-NVFP4 的生产级优化实践,采用 4P1D 的 P/D 分离拓扑将平均 TPOT 从 40ms 降至 17ms,达成 TTFT ≤ 2.5s 与 TPOT ≤ 20ms 的 SLA 目标。
推荐理由:文章详细拆解了超大 MoE 模型在长上下文与投机解码下的端到端调优路径,给出了完整的部署配置与长周期排障经验。
vLLM 宣布首日支持月之暗面 2.8T 参数模型 Kimi K3,提供混合 KDA 前缀缓存与 DSpark 投机解码等生产级部署方案。在 16 卡 NVIDIA GB300 NVL72 上配合 DSpark 投机解码单用户吞吐可达 370 tok/s,解码速度提升 3.14 倍。
推荐理由:文章详细拆解了针对超大混合架构模型的缓存改造与投机解码方案,为同类长上下文 MoE 的高效部署提供了完整参考。
Speculators 与 vLLM 宣布全面开源支持 P-EAGLE、DFlash 和 DSpark 三种并行推测解码算法,摆脱了 EAGLE-3 等传统框架自回归逐词生成候选 token 的延迟瓶颈。
推荐理由:原文解析了三种并行推测解码架构与训练优化机制,为大模型在线服务降低草稿延迟与参数调优负担提供了工程参考。
Modal 与卡内基梅隆大学联合推出专为 AI-SQL 负载设计的推理层 Quail(QUery-Aware Inference Layer),通过联合优化查询规划器与推理引擎提升分析型数据库中的大模型吞吐。
推荐理由:原文针对分析型数据库中的大模型推理负载,通过联合查询规划与缓存管理协同优化,为高吞吐纯 Prefill 场景提供了可借鉴的架构方案。
OpenAI 在 DevDay 活动上正式发布 GPT-6.1 Sol 模型,称其在智能体编码、计算机操作及专业工作上的智能水平接近 GPT-6 Astra,而标准输入与输出 token 价格仅为后者的五分之一。
推荐理由:新模型以五分之一的价格提供接近旗舰模型的智能水平,并改进了低推理强度下的事实准确率与安全遵从度。
Cerebras 发布 GPT-5.6 家族(Sol、Terra 与 Luna)使用指南,详解三款模型在智能水平、推理速度与调用成本上的权衡策略。
推荐理由:文章系统梳理了各尺寸模型在多智能体系统中的梯队搭配与缓存复用策略,便于优化长任务工作流与控制成本。
Cerebras 与 OpenAI 联合推出由 Cerebras 晶圆级架构驱动的 Ultrafast Mode,GPT-5.6 Sol 在该模式下输出速度最高可达 750 output tokens per second。
推荐理由:原文给出了 Cerebras 驱动大模型超高速推理的实测吞吐与基准耗时,读者可以据此判断高吞吐推理对实时智能体交互的改进幅度。
Cerebras 在 HOT CHIPS 2026 上详细解析了基于 Nexus 机架平台的 CS-4 系统架构,并公布了 CS-5 与 CS-6 的技术演进路线。
推荐理由:Cerebras 披露了 CS-4 机架级供电与散热架构细节,并展示了通过 3D 堆叠 DRAM 突破晶圆级内存瓶颈的技术演进路径。
Cerebras 通过其 WSE-3 晶圆级芯片支持 OpenAI GPT-5.6 Sol 的 Ultrafast 模式,在不降低精度、不蒸馏且不改变权重的条件下实现了高达 750 output tokens/s 的推理速度。
推荐理由:文章详细拆解了晶圆级芯片利用片上超大带宽 SRAM 消除显存墙以实现高速大模型推理的硬件架构与工程实现。
Cerebras 评测了主流 AI 个人助手的执行效率,并通过架构工程将日常订餐任务耗时从数分钟压缩至 22 秒。
推荐理由:文章拆解了智能体执行任务耗时过长的瓶颈,通过并行查询、硬件加速与交互流程沉淀提供了实测提速方案。
Cerebras 正式发布第四代 AI 加速系统 CS-4,搭载三颗 Wafer Scale Engine 3 Turbo 处理器并采用全新 Nexus 机柜架构,官方称其推理速度最高可达 GPU 系统的 30 倍。
推荐理由:CS-4 将晶圆级算力与解耦推理结合,为十万亿参数超大模型的交互式生成提供了不同于传统集群的低延迟硬件方案。
Anthropic 正式推出 Claude Haiku 4.5,在编码、电脑使用及智能体任务上达到 Sonnet 4 水平,并在 SWE-bench Verified 基准测试中取得 73.3% 的成绩。
推荐理由:原文对比了该轻量模型与旗舰版本的编码和推理表现,读者可以据此评估多智能体协作与大规模调用的性价比边界。
Anthropic 正式推出 Claude Sonnet 5.5 混合推理模型,具备 1M 上下文窗口,运行速度相比 Sonnet 5 提升 30% 且典型工作流成本降低最高达 30%。
推荐理由:官方公布了新模型的定价与多场景实测数据,开发者可以据此评估高频编码与 Agent 任务的替换成本。
Anthropic 正式推出混合推理模型 Claude Opus 5.5,具备 1M 上下文窗口,在典型工作负载下的运行成本较 Opus 5 降低约 40%。
推荐理由:该模型在保持前沿智能的同时大幅压缩了长程智能体与复杂代码任务的步数与运行成本。
vLLM 团队公布了基于 GB200 NVL72 系统的 Qwen3.5-397B-A17B-NVFP4 解耦推理优化方案,实现单 GPU 总吞吐超过 25,000 TPS。
推荐理由:原文展示了混合注意力架构模型在解耦推理下的状态传输与算子优化方案,读者可参考其配置配方提升大模型吞吐。
vLLM 官方详解了解码上下文并行(DCP)机制,通过沿序列维度将 KV Cache 分片到多张 GPU,在长上下文智能体负载下实现相比标准张量并行 3 倍的吞吐提升。
推荐理由:针对长上下文推理中多头及潜变量注意力导致的显存冗余,原文给出了按序列分片提升并发与吞吐的实现方案。
vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型,提供兼容 OpenAI 的 API 接口及完整的高吞吐推理部署方案。该模型采用 30B 总参数、3B 激活参数的混合 MoE 架构,支持 100 万 token 上下文并提供 BF16 与 NVFP4 权重。
推荐理由:文章提供了在多种硬件平台上利用投机解码加速运行该智能体模型的完整部署配置与调优方法。
vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型,提供开箱即用的推理服务。该模型为 2.4T 参数的稀疏混合专家(MoE)架构,包含 512 个专家并采用全注意力与线性注意力的混合主干。除官方 FP8 和 BF16 权重外,vLLM 还支持 NVFP4 与 MXFP4 量化版本,可在单节点 NVIDIA B300 或 AMD MI355X 上完成高效推理。
推荐理由:原文提供了超大混合专家模型的推理部署命令与多硬件算子优化细节,便于工程团队评估大模型服务资源。