跳到正文
今天9月30日周三
  1. vLLM 官方博客(网页)65

    vLLM 与 Speculators 支持 P-EAGLE、DFlash 和 DSpark 并行推测解码算法

    Speculators 与 vLLM 宣布全面开源支持 P-EAGLE、DFlash 和 DSpark 三种并行推测解码算法,摆脱了 EAGLE-3 等传统框架自回归逐词生成候选 token 的延迟瓶颈。

    推荐理由:原文解析了三种并行推测解码架构与训练优化机制,为大模型在线服务降低草稿延迟与参数调优负担提供了工程参考。

  2. Hacker News · AI65

    Modal 推出 AI-SQL 推理引擎 Quail,多表关联查询吞吐达 vLLM 的 10 倍以上

    Modal 与卡内基梅隆大学联合推出专为 AI-SQL 负载设计的推理层 Quail(QUery-Aware Inference Layer),通过联合优化查询规划器与推理引擎提升分析型数据库中的大模型吞吐。

    推荐理由:原文针对分析型数据库中的大模型推理负载,通过联合查询规划与缓存管理协同优化,为高吞吐纯 Prefill 场景提供了可借鉴的架构方案。

  3. TechCrunch AI87

    OpenAI 发布 GPT-6.1 Sol:性能接近 GPT-6 Astra 且价格更低

    OpenAI 在 DevDay 活动上正式发布 GPT-6.1 Sol 模型,称其在智能体编码、计算机操作及专业工作上的智能水平接近 GPT-6 Astra,而标准输入与输出 token 价格仅为后者的五分之一。

    推荐理由:新模型以五分之一的价格提供接近旗舰模型的智能水平,并改进了低推理强度下的事实准确率与安全遵从度。

  4. IT168 服务器存储 · AI与算力(网页)49

    从“算力焦虑”到“算力理性”:Akamai解答AI推理时代的ROI之问

    Akamai云计算CTO Jay Jenkins指出,约75%至95%的AI算力投资未转化为可衡量的财务回报,企业应摆脱集中式堆砌并采用分布式架构优化推理ROI。他强调推理面临网络带宽、延迟损失及合规治理等隐性成本,需结合语义缓存、推测解码与边缘编排来提升GPU利用率。针对多智能体协作与合规挑战,分布式边缘节点有助于降低累积延迟并实现数据本地化。

  5. Cerebras 官方博客(网页)36

    更快的推理速度如何为网络安全公司带来竞争优势

    更快的模型推理速度使网络安全系统能在同一操作窗口内完成更多上下文检索、深度推理与多重验证,成为安全产品的核心竞争优势。在实际落地中,安全架构通常采用分层设计,先由规则和轻量模型完成快速初筛与分类,再将高风险及敏感事件升级交给强推理模型进行深度分析。

  6. Cerebras 官方博客(网页)70

    Cerebras 联合 OpenAI 推出 Ultrafast Mode:驱动 GPT-5.6 Sol 达到每秒 750 Token

    Cerebras 与 OpenAI 联合推出由 Cerebras 晶圆级架构驱动的 Ultrafast Mode,GPT-5.6 Sol 在该模式下输出速度最高可达 750 output tokens per second。

    推荐理由:原文给出了 Cerebras 驱动大模型超高速推理的实测吞吐与基准耗时,读者可以据此判断高吞吐推理对实时智能体交互的改进幅度。

  7. Cerebras 官方博客(网页)77

    Cerebras 如何实现 GPT-5.6 Sol 高达每秒 750 tokens 的高速推理

    Cerebras 通过其 WSE-3 晶圆级芯片支持 OpenAI GPT-5.6 Sol 的 Ultrafast 模式,在不降低精度、不蒸馏且不改变权重的条件下实现了高达 750 output tokens/s 的推理速度。

    推荐理由:文章详细拆解了晶圆级芯片利用片上超大带宽 SRAM 消除显存墙以实现高速大模型推理的硬件架构与工程实现。

  8. Cerebras 官方博客(网页)38

    Cerebras:为什么网络防御需要更快的 AI 推理

    Cerebras AI 推理运行 GPT-5.6 Sol Ultrafast 比标准处理快达 14×,可将网络安全分类与响应速度提升 5–10×。在可疑文件分析测试中,Cerebras 仅耗时 58 秒,而标准处理需 4 分 43 秒。此外,Cerebras 携手 CrowdStrike Falcon AI 检测与响应平台,为告警分流与威胁搜猎等场景提供推理加速。

  9. Cerebras 官方博客(网页)68

    Cerebras 发布第四代 AI 系统 CS-4:推理速度最高达 GPU 的 30 倍并支持解耦架构

    Cerebras 正式发布第四代 AI 加速系统 CS-4,搭载三颗 Wafer Scale Engine 3 Turbo 处理器并采用全新 Nexus 机柜架构,官方称其推理速度最高可达 GPU 系统的 30 倍。

    推荐理由:CS-4 将晶圆级算力与解耦推理结合,为十万亿参数超大模型的交互式生成提供了不同于传统集群的低延迟硬件方案。

  10. Cerebras 官方博客(网页)6

    Cerebras 白皮书

    Cerebras 发布的性能对比数据基于第三方基准测试或内部测试得出。其相较于基于 GPU 系统的推理速度提升表现,会因实际工作负载、配置、测试日期及测试模型而存在差异。

  11. Cerebras 官方博客(网页)10

    Cerebras 新闻动态

    Cerebras 说明其与 GPU 系统的性能对比均基于第三方基准或内部测试。相较于基于 GPU 的系统,所观察到的推理速度提升可能会因具体工作负载、硬件配置、测试日期以及所测模型而有所差异。

  12. Cerebras 官方博客(网页)23

    Cerebras 新闻中心

    Cerebras 新闻中心汇总了最新业务与技术进展,宣布推出新一代 Cerebras CS-4 系统。Cerebras 联手 Compute Nordic Finland 在芬兰米凯利建设 165 MW AI 数据中心,并为 Gimlet Labs 等平台提供超高速 AI 推理支持。

  13. Cerebras 官方博客(网页)19

    Cerebras:关于我们

    Cerebras 成立于 2015 年,专注于提供 AI 推理与训练计算平台,支持机构构建本地超级计算机并通过按需付费云服务对外提供算力。其技术目前应用于医学研究、密码学、能源以及智能体 AI 等领域。该公司投资者包括 Sam Altman、Greg Brockman、Ilya Sutskever 等多位科技行业知名人士。

  14. Cerebras 官方博客(网页)56

    General Compute 与 Cerebras 达成多年合作,规模化部署超快推理支持智能体编程

    General Compute 与 Cerebras 宣布达成多年合作协议,将规模化部署 Cerebras 超快推理硬件,首个落地场景为智能体编程。该方案针对编码智能体多步连续推理调用导致的时延累积痛点,旨在为开发者提供低延迟推理支持;基于 Cerebras 晶圆级芯片的推理服务预计将于 2027 年第一季度正式上线。

  15. Cerebras 官方博客(网页)11

    Cerebras 定价

    Cerebras 针对其推理性能对比发布说明,指出相关数据基于第三方基准测试或内部测试。相较于基于 GPU 的系统,所观察到的推理速度提升幅度会因工作负载、配置、测试日期以及受测模型的不同而有所差异。

  16. Cerebras 官方博客(网页)7

    Cerebras 客户

    Cerebras 说明其性能对比数据基于第三方基准测试或内部测试结果。相较于基于 GPU 系统的推理速度提升可能会受具体工作负载、配置、测试日期及所测试模型的影响而有所差异。

  17. Claude 官方博客(网页)84

    Anthropic 发布 Claude Haiku 4.5 模型

    Anthropic 正式推出 Claude Haiku 4.5,在编码、电脑使用及智能体任务上达到 Sonnet 4 水平,并在 SWE-bench Verified 基准测试中取得 73.3% 的成绩。

    推荐理由:原文对比了该轻量模型与旗舰版本的编码和推理表现,读者可以据此评估多智能体协作与大规模调用的性价比边界。

  18. Claude 官方博客(网页)89

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 正式推出 Claude Sonnet 5.5 混合推理模型,具备 1M 上下文窗口,运行速度相比 Sonnet 5 提升 30% 且典型工作流成本降低最高达 30%。

    推荐理由:官方公布了新模型的定价与多场景实测数据,开发者可以据此评估高频编码与 Agent 任务的替换成本。

  19. vLLM 官方博客(网页)77

    vLLM 详解解码上下文并行 DCP:长上下文智能体推理吞吐提升 3 倍

    vLLM 官方详解了解码上下文并行(DCP)机制,通过沿序列维度将 KV Cache 分片到多张 GPU,在长上下文智能体负载下实现相比标准张量并行 3 倍的吞吐提升。

    推荐理由:针对长上下文推理中多头及潜变量注意力导致的显存冗余,原文给出了按序列分片提升并发与吞吐的实现方案。

  20. vLLM 官方博客(网页)75

    vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型推理

    vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型,提供兼容 OpenAI 的 API 接口及完整的高吞吐推理部署方案。该模型采用 30B 总参数、3B 激活参数的混合 MoE 架构,支持 100 万 token 上下文并提供 BF16 与 NVFP4 权重。

    推荐理由:文章提供了在多种硬件平台上利用投机解码加速运行该智能体模型的完整部署配置与调优方法。

  21. vLLM 官方博客(网页)79

    vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型推理

    vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型,提供开箱即用的推理服务。该模型为 2.4T 参数的稀疏混合专家(MoE)架构,包含 512 个专家并采用全注意力与线性注意力的混合主干。除官方 FP8 和 BF16 权重外,vLLM 还支持 NVFP4 与 MXFP4 量化版本,可在单节点 NVIDIA B300 或 AMD MI355X 上完成高效推理。

    推荐理由:原文提供了超大混合专家模型的推理部署命令与多硬件算子优化细节,便于工程团队评估大模型服务资源。

  22. vLLM 官方博客(网页)69

    vLLM 在 AMD GPU 上的投机解码实践指南与性能实测

    vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。

    推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。

  23. vLLM 官方博客(网页)72

    vLLM 引入 Hybrid HiSparse 混合稀疏卸载优化,支持 GLM 5.3 单机长上下文高并发推理

    vLLM 针对 GLM 5.3 推出 Hybrid HiSparse 混合稀疏卸载优化机制,使单个 8× H200 节点即可运行 100 万全长上下文并显著提升并发能力。

    推荐理由:文章给出了混合稀疏卸载机制在单节点上的显存管理设计,为长上下文大模型推理的高并发部署提供了实用方案。

  24. vLLM 官方博客(网页)67

    vLLM 发布 Kimi K3 性能优化:端到端吞吐提升达 2.8 倍

    vLLM 宣布针对 Kimi K3 模型完成全栈推理性能优化,在 B300 节点 8K/1K 负载下实现端到端吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%,平均延迟降低 56%–60%。

    推荐理由:原文给出了从自适应调度、KDA 检查点到 ReplaySSM 的全栈优化细节,读者可据此参考混合架构大模型推理加速方案。

  25. vLLM 官方博客(网页)69

    vLLM 团队基于 GB300 NVL72 与 Mooncake 训练 Kimi K3 的 DSpark 投机草稿模型

    vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。

    推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。

  26. vLLM 官方博客(网页)65

    vLLM 详解 Qwen3.8-2.4T 的 PD 分离推理优化实践

    vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。

    推荐理由:文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。

  27. vLLM 官方博客(网页)66

    深入解析 vLLM:高吞吐大语言模型推理系统的架构剖析

    vLLM 官方博客发布技术长文深度剖析其 V1 推理引擎,系统拆解从单卡底层内核到大规模分布式服务的完整架构。文章详细解读了调度器运行机制、PagedAttention 内存分配与连续批处理流程,并深入探讨分块 Prefill、前缀缓存、基于有限状态机的引导解码、推测解码以及 Prefill/Decode 分离等高级特性。

    推荐理由:文章从单机引擎内核层层拆解到多节点分布式服务,为理解和优化高吞吐大模型推理系统提供了完整清晰的架构参考。

  28. vLLM 官方博客(网页)36

    vLLM 开源大语言模型推理与服务库介绍

    vLLM 是源自 UC Berkeley Sky Computing Lab 的开源大语言模型推理与服务库,拥有超过 2000 位社区贡献者。该框架采用 PagedAttention、连续批处理与前缀缓存技术,支持 FP8/INT4 等多种量化方案及 200 多种模型架构。系统提供兼容 OpenAI 与 Anthropic 的 API 服务,并广泛适配 NVIDIA、AMD 等多种硬件平台。

  29. vLLM 官方博客(网页)31

    vLLM 社区概览

    vLLM 是面向大语言模型(LLM)的高吞吐与高内存效率推理服务引擎,支持在 CUDA、ROCm、XPU 及 CPU 等硬件上部署并提供兼容 OpenAI 的 API。该引擎通过 PagedAttention 与连续批处理(continuous batching)提升 GPU 利用率以降低推理成本,并获得 a16z、Sequoia Capital 及 NVIDIA 等机构的资金与算力支持。