Cerebras 如何实现 GPT-5.6 Sol 高达每秒 750 tokens 的高速推理
Cerebras 通过其 WSE-3 晶圆级芯片支持 OpenAI GPT-5.6 Sol 的 Ultrafast 模式,在不降低精度、不蒸馏且不改变权重的条件下实现了高达 750 output tokens/s 的推理速度。
推荐理由:文章详细拆解了晶圆级芯片利用片上超大带宽 SRAM 消除显存墙以实现高速大模型推理的硬件架构与工程实现。
Cerebras 通过其 WSE-3 晶圆级芯片支持 OpenAI GPT-5.6 Sol 的 Ultrafast 模式,在不降低精度、不蒸馏且不改变权重的条件下实现了高达 750 output tokens/s 的推理速度。
推荐理由:文章详细拆解了晶圆级芯片利用片上超大带宽 SRAM 消除显存墙以实现高速大模型推理的硬件架构与工程实现。
Cerebras 评测了主流 AI 个人助手的执行效率,并通过架构工程将日常订餐任务耗时从数分钟压缩至 22 秒。
推荐理由:文章拆解了智能体执行任务耗时过长的瓶颈,通过并行查询、硬件加速与交互流程沉淀提供了实测提速方案。
Cerebras AI 推理运行 GPT-5.6 Sol Ultrafast 比标准处理快达 14×,可将网络安全分类与响应速度提升 5–10×。在可疑文件分析测试中,Cerebras 仅耗时 58 秒,而标准处理需 4 分 43 秒。此外,Cerebras 携手 CrowdStrike Falcon AI 检测与响应平台,为告警分流与威胁搜猎等场景提供推理加速。
Cerebras 正式发布第四代 AI 加速系统 CS-4,搭载三颗 Wafer Scale Engine 3 Turbo 处理器并采用全新 Nexus 机柜架构,官方称其推理速度最高可达 GPU 系统的 30 倍。
推荐理由:CS-4 将晶圆级算力与解耦推理结合,为十万亿参数超大模型的交互式生成提供了不同于传统集群的低延迟硬件方案。
Cerebras 发布的性能对比数据基于第三方基准测试或内部测试得出。其相较于基于 GPU 系统的推理速度提升表现,会因实际工作负载、配置、测试日期及测试模型而存在差异。
Cerebras 说明其与 GPU 系统的性能对比均基于第三方基准或内部测试。相较于基于 GPU 的系统,所观察到的推理速度提升可能会因具体工作负载、硬件配置、测试日期以及所测模型而有所差异。
Cerebras 新闻中心汇总了最新业务与技术进展,宣布推出新一代 Cerebras CS-4 系统。Cerebras 联手 Compute Nordic Finland 在芬兰米凯利建设 165 MW AI 数据中心,并为 Gimlet Labs 等平台提供超高速 AI 推理支持。
Cerebras 成立于 2015 年,专注于提供 AI 推理与训练计算平台,支持机构构建本地超级计算机并通过按需付费云服务对外提供算力。其技术目前应用于医学研究、密码学、能源以及智能体 AI 等领域。该公司投资者包括 Sam Altman、Greg Brockman、Ilya Sutskever 等多位科技行业知名人士。
General Compute 与 Cerebras 宣布达成多年合作协议,将规模化部署 Cerebras 超快推理硬件,首个落地场景为智能体编程。该方案针对编码智能体多步连续推理调用导致的时延累积痛点,旨在为开发者提供低延迟推理支持;基于 Cerebras 晶圆级芯片的推理服务预计将于 2027 年第一季度正式上线。
Cerebras 针对其推理性能对比发布说明,指出相关数据基于第三方基准测试或内部测试。相较于基于 GPU 的系统,所观察到的推理速度提升幅度会因工作负载、配置、测试日期以及受测模型的不同而有所差异。
Cerebras 说明其性能对比数据基于第三方基准测试或内部测试结果。相较于基于 GPU 系统的推理速度提升可能会受具体工作负载、配置、测试日期及所测试模型的影响而有所差异。
Anthropic 正式推出 Claude Haiku 4.5,在编码、电脑使用及智能体任务上达到 Sonnet 4 水平,并在 SWE-bench Verified 基准测试中取得 73.3% 的成绩。
推荐理由:原文对比了该轻量模型与旗舰版本的编码和推理表现,读者可以据此评估多智能体协作与大规模调用的性价比边界。
Anthropic 正式推出 Claude Sonnet 5.5 混合推理模型,具备 1M 上下文窗口,运行速度相比 Sonnet 5 提升 30% 且典型工作流成本降低最高达 30%。
推荐理由:官方公布了新模型的定价与多场景实测数据,开发者可以据此评估高频编码与 Agent 任务的替换成本。
Anthropic 正式推出混合推理模型 Claude Opus 5.5,具备 1M 上下文窗口,在典型工作负载下的运行成本较 Opus 5 降低约 40%。
推荐理由:该模型在保持前沿智能的同时大幅压缩了长程智能体与复杂代码任务的步数与运行成本。
Transluce 将用于监控和理解 AI 内部状态的激活先知(Activation Oracles)扩展至 1.1T 参数模型(如 Kimi-K2.6 与 GLM-4.5),验证了先知性能随模型规模、数据量和质量提升的扩展规律。
vLLM 团队公布了基于 GB200 NVL72 系统的 Qwen3.5-397B-A17B-NVFP4 解耦推理优化方案,实现单 GPU 总吞吐超过 25,000 TPS。
推荐理由:原文展示了混合注意力架构模型在解耦推理下的状态传输与算子优化方案,读者可参考其配置配方提升大模型吞吐。
vLLM 官方详解了解码上下文并行(DCP)机制,通过沿序列维度将 KV Cache 分片到多张 GPU,在长上下文智能体负载下实现相比标准张量并行 3 倍的吞吐提升。
推荐理由:针对长上下文推理中多头及潜变量注意力导致的显存冗余,原文给出了按序列分片提升并发与吞吐的实现方案。
vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型,提供兼容 OpenAI 的 API 接口及完整的高吞吐推理部署方案。该模型采用 30B 总参数、3B 激活参数的混合 MoE 架构,支持 100 万 token 上下文并提供 BF16 与 NVFP4 权重。
推荐理由:文章提供了在多种硬件平台上利用投机解码加速运行该智能体模型的完整部署配置与调优方法。
vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型,提供开箱即用的推理服务。该模型为 2.4T 参数的稀疏混合专家(MoE)架构,包含 512 个专家并采用全注意力与线性注意力的混合主干。除官方 FP8 和 BF16 权重外,vLLM 还支持 NVFP4 与 MXFP4 量化版本,可在单节点 NVIDIA B300 或 AMD MI355X 上完成高效推理。
推荐理由:原文提供了超大混合专家模型的推理部署命令与多硬件算子优化细节,便于工程团队评估大模型服务资源。
vLLM 在 PR #47808 中合并了 DSpark 自适应验证功能(enable_adaptive_verification),通过置信度预测头动态调度草稿验证预算,使投机解码在并发度 1 至 256 下均保持在吞吐与延迟的帕累托前沿。
vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。
推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。
vLLM 针对 GLM 5.3 推出 Hybrid HiSparse 混合稀疏卸载优化机制,使单个 8× H200 节点即可运行 100 万全长上下文并显著提升并发能力。
推荐理由:文章给出了混合稀疏卸载机制在单节点上的显存管理设计,为长上下文大模型推理的高并发部署提供了实用方案。
vLLM 针对 AMD Instinct MI355X 优化 MiniMax M3 推理性能,在并发 32 下将 MXFP8 吞吐提升 3.14 倍至 342.4 output tokens/s/GPU。
vLLM 宣布针对 Kimi K3 模型完成全栈推理性能优化,在 B300 节点 8K/1K 负载下实现端到端吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%,平均延迟降低 56%–60%。
推荐理由:原文给出了从自适应调度、KDA 检查点到 ReplaySSM 的全栈优化细节,读者可据此参考混合架构大模型推理加速方案。
vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。
推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。
vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。
推荐理由:文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。
vLLM 宣布支持基于 Gumbel-max 算法的无失真文本水印功能,在不改变模型原始输出分布的前提下实现文本来源溯源。
推荐理由:官方详解了如何在高性能推理引擎中落地无失真文本水印,对兼顾生成质量、投机解码与吞吐性能有直接工程参考价值。
vLLM 官方博客发布技术长文深度剖析其 V1 推理引擎,系统拆解从单卡底层内核到大规模分布式服务的完整架构。文章详细解读了调度器运行机制、PagedAttention 内存分配与连续批处理流程,并深入探讨分块 Prefill、前缀缓存、基于有限状态机的引导解码、推测解码以及 Prefill/Decode 分离等高级特性。
推荐理由:文章从单机引擎内核层层拆解到多节点分布式服务,为理解和优化高吞吐大模型推理系统提供了完整清晰的架构参考。
vLLM 是源自 UC Berkeley Sky Computing Lab 的开源大语言模型推理与服务库,拥有超过 2000 位社区贡献者。该框架采用 PagedAttention、连续批处理与前缀缓存技术,支持 FP8/INT4 等多种量化方案及 200 多种模型架构。系统提供兼容 OpenAI 与 Anthropic 的 API 服务,并广泛适配 NVIDIA、AMD 等多种硬件平台。
vLLM 是面向大语言模型(LLM)的高吞吐与高内存效率推理服务引擎,支持在 CUDA、ROCm、XPU 及 CPU 等硬件上部署并提供兼容 OpenAI 的 API。该引擎通过 PagedAttention 与连续批处理(continuous batching)提升 GPU 利用率以降低推理成本,并获得 a16z、Sequoia Capital 及 NVIDIA 等机构的资金与算力支持。
vLLM 宣布开放常年人才库招聘与岗位内推,面向美国旧金山湾区及中国北京、上海、深圳、广州、成都等地招募实习与全职人才。官方表示为优秀推理工程师提供不设上限的薪酬待遇,投递简历将与合作企业共享。此外,该渠道还支持人才库对接、Meetup 组织与技术合作,并为被搁置的重要代码贡献提供跟进反馈入口。
vLLM 是一款开源的大语言模型推理与服务库,由 UC Berkeley Sky Computing Lab 发起并由超 2000 名贡献者共同维护。该框架通过 PagedAttention、连续批处理、多样化量化与投机解码实现高吞吐量服务,并支持张量及流水线等分布式并行推理。
Amazon Bedrock 现已支持 Anthropic 模型在首尔(Claude Opus 5 与 Claude Sonnet 5)及新加坡(Claude Sonnet 5)的区域内推理。
Gamow Labs 推出基于真实药物研发与基因组学湿实验记录的评测基准 LabBench,用于评估 AI 智能体决定下一步实验的能力。在 20 项任务测试中,GPT-6 Astra(40.8%)与 Claude Opus 5.5(40.5%)平均通过率并列领先,但 Astra 中位耗时 5 分钟远快于 Opus 的 35 分钟。
推荐理由:评测通过真实湿实验记录量化了模型在实验决策上的短板,为理解智能体在科研工作流中的能力边界提供了参考。
vLLM 发布候选版本 v0.31.0rc2。该版本主要包含针对 Mamba 模型的 Bug 修复,在稀疏相关场景下保留 prompt-end prefill 检查点。
GPT-6.1 Sol 已在 Amazon Bedrock 正式全面可用(GA),重点增强了智能体编码、计算机使用和多步骤日常工作流的推理能力。根据 OpenAI 评测数据,GPT-6.1 Sol 在 DeepSWE v1.1 上的表现媲美 GPT-6 Astra,而单任务成本仅约为后者的五分之一,得分比 GPT-6 Sol 高出 6.4 个百分点。
推荐理由:原文介绍了模型上线云端托管后的性能与成本表现,企业读者可据此评估其在智能体工作流中的部署性价比。
OpenAI 推出新模型 GPT-6.1 Sol,在旗舰模型 GPT-6.1 Astra 因安全顾虑延期之际,以约五分之一的成本提供接近后者的 Agent 编码与办公能力。
推荐理由:在旗舰模型 Astra 因安全顾虑推迟发布的背景下,Sol 以更低成本提供接近的表现,便于开发者权衡 Agent 任务的落地性价比。
Microsoft Research 推出生物学 AI 研究系统 Quine,由多模态生物学世界模型以及连接科研工具、文献与湿实验的交互框架组成。系统联合学习基因组、蛋白质、细胞状态及生物成像等跨尺度数据,以预测干预后的生物状态演变;在与 Broad Institute 合作的胰腺癌研究中,Quine 快速完成化合物筛选并在湿实验中验证了候选分子。
推荐理由:原文展示了生物学世界模型与湿实验结合的闭环流程,读者可据此了解 AI 辅助跨模态生物学推理与药物筛选的具体范式。
Sebastian Raschka 系统梳理了从传统词袋模型、RNN、CNN、BERT 到当前通用决策模型 Jev 的文本分类技术演化历程。实测显示 TypeSafe AI 推出的 Jev 在 IMDb 测试集上达到 96.47% 准确率,具备远低于大模型的推理延迟和调用成本,其核心优势来自高质量合成数据训练与面向决策校准的强化学习(RLCD)。
推荐理由:文章梳理了文本分类架构演进脉络,拆解了通用决策模型实现低延迟与概率校准的技术路径,适合作为分类与 Agent 路由优化的参考。
至知创新研究院(IQuest Research)发布 IQuest-Q1 模型,采用 Decoder-only 稀疏 MoE 架构,总参数约 320B、激活参数约 15B。
推荐理由:原文介绍了 320B 总参数但仅激活 15B 的稀疏 MoE 模型,展示了其在复杂代码长程排错与交互生成任务中的实际表现。