跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

168条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 61–80 条 · 共 168 条
9月30日周三
  1. AWS 机器学习80

    AWS 宣布在 Amazon Bedrock 与 Claude Platform 上线 Claude Sonnet 5.5

    AWS 正式在 Amazon Bedrock 和 Claude Platform on AWS 上提供 Claude Sonnet 5.5。该模型针对聚焦型编程和知识工作优化,具备更快的执行速度与更低的任务单价,支持与 IAM、CloudTrail、CloudWatch 及 Bedrock Guardrails 等 AWS 原生治理工具集成。

    推荐理由:文章明确了该模型在企业工程中的分工定位与调用方式,便于开发者评估架构组合与成本配比。

  2. Cerebras 官方博客(网页)70

    Cerebras 联合 OpenAI 推出 Ultrafast Mode:驱动 GPT-5.6 Sol 达到每秒 750 Token

    Cerebras 与 OpenAI 联合推出由 Cerebras 晶圆级架构驱动的 Ultrafast Mode,GPT-5.6 Sol 在该模式下输出速度最高可达 750 output tokens per second。

    推荐理由:原文给出了 Cerebras 驱动大模型超高速推理的实测吞吐与基准耗时,读者可以据此判断高吞吐推理对实时智能体交互的改进幅度。

  3. Cerebras 官方博客(网页)77

    Cerebras 如何实现 GPT-5.6 Sol 高达每秒 750 tokens 的高速推理

    Cerebras 通过其 WSE-3 晶圆级芯片支持 OpenAI GPT-5.6 Sol 的 Ultrafast 模式,在不降低精度、不蒸馏且不改变权重的条件下实现了高达 750 output tokens/s 的推理速度。

    推荐理由:文章详细拆解了晶圆级芯片利用片上超大带宽 SRAM 消除显存墙以实现高速大模型推理的硬件架构与工程实现。

  4. Cerebras 官方博客(网页)68

    Cerebras 发布第四代 AI 系统 CS-4:推理速度最高达 GPU 的 30 倍并支持解耦架构

    Cerebras 正式发布第四代 AI 加速系统 CS-4,搭载三颗 Wafer Scale Engine 3 Turbo 处理器并采用全新 Nexus 机柜架构,官方称其推理速度最高可达 GPU 系统的 30 倍。

    推荐理由:CS-4 将晶圆级算力与解耦推理结合,为十万亿参数超大模型的交互式生成提供了不同于传统集群的低延迟硬件方案。

  5. vLLM 官方博客(网页)77

    vLLM 详解解码上下文并行 DCP:长上下文智能体推理吞吐提升 3 倍

    vLLM 官方详解了解码上下文并行(DCP)机制,通过沿序列维度将 KV Cache 分片到多张 GPU,在长上下文智能体负载下实现相比标准张量并行 3 倍的吞吐提升。

    推荐理由:针对长上下文推理中多头及潜变量注意力导致的显存冗余,原文给出了按序列分片提升并发与吞吐的实现方案。

  6. vLLM 官方博客(网页)75

    vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型推理

    vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型,提供兼容 OpenAI 的 API 接口及完整的高吞吐推理部署方案。该模型采用 30B 总参数、3B 激活参数的混合 MoE 架构,支持 100 万 token 上下文并提供 BF16 与 NVFP4 权重。

    推荐理由:文章提供了在多种硬件平台上利用投机解码加速运行该智能体模型的完整部署配置与调优方法。

  7. vLLM 官方博客(网页)79

    vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型推理

    vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型,提供开箱即用的推理服务。该模型为 2.4T 参数的稀疏混合专家(MoE)架构,包含 512 个专家并采用全注意力与线性注意力的混合主干。除官方 FP8 和 BF16 权重外,vLLM 还支持 NVFP4 与 MXFP4 量化版本,可在单节点 NVIDIA B300 或 AMD MI355X 上完成高效推理。

    推荐理由:原文提供了超大混合专家模型的推理部署命令与多硬件算子优化细节,便于工程团队评估大模型服务资源。

  8. vLLM 官方博客(网页)72

    vLLM-Omni 推出分布式分层卸载技术,支持超显存容量 DiT 模型高效推理

    vLLM-Omni 推出分布式分层卸载(DLO)技术,通过 Meta 设备与 mmap 加载、权重切分重构、双缓冲预取以及数据并行多并发,使单卡显存不足的超大视频生成模型可在多卡 GPU 或 NPU 上高效运行。

    推荐理由:vLLM-Omni 结合 mmap 与多流 AllGather 卸载降低显存与内存峰值,为大参数量扩散模型的低成本分布式推理提供了落地路径。

  9. vLLM 官方博客(网页)70

    vLLM 基于 Ray Direct Transport 实现大规模分片权重传输引擎

    vLLM 联合 NIXL 团队推出了基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 台 8×H100 节点集群上实现 Kimi K2 模型 BF16 格式 7.9TB 权重在 7.53 秒内完成同步,聚合带宽达 1,049 GB/s。

    推荐理由:针对在线强化学习超大 MoE 权重同步慢且显存开销高的问题,该方案通过分片点对点拉取与流水线重叠优化提供了高效的训推协同实践路径。

  10. vLLM 官方博客(网页)69

    vLLM 在 AMD GPU 上的投机解码实践指南与性能实测

    vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。

    推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。

  11. vLLM 官方博客(网页)75

    vLLM-Omni 支持 MiniMax H3 系统级优化与 FastH3 实时推理

    vLLM-Omni 宣布完成对 MiniMax H3 的全栈推理优化并集成 FastVideo 的 4 步蒸馏方案 FastH3,实现了生成速度快于播放时长的端到端实时服务。

    推荐理由:文章拆解了音视频联合生成从 DiT 到 VAE 及视频封装的全链路瓶颈,为多模态大模型的低延迟部署提供了系统级参考。

  12. vLLM 官方博客(网页)77

    vLLM 针对真实 Agent 工作负载推出全栈推理服务优化

    vLLM 针对多轮会话、长上下文及高前缀复用的 Agent 工作负载推出全栈推理优化方案,涵盖统一内存页混合 KV cache 管理、分层离线卸载、模型自适应并行及防队头阻塞调度。

    推荐理由:原文梳理了长上下文与高前缀复用负载下的全栈推理优化方案,为大模型智能体部署和算力选型提供了实测参考。

  13. vLLM 官方博客(网页)72

    vLLM 引入 Hybrid HiSparse 混合稀疏卸载优化,支持 GLM 5.3 单机长上下文高并发推理

    vLLM 针对 GLM 5.3 推出 Hybrid HiSparse 混合稀疏卸载优化机制,使单个 8× H200 节点即可运行 100 万全长上下文并显著提升并发能力。

    推荐理由:文章给出了混合稀疏卸载机制在单节点上的显存管理设计,为长上下文大模型推理的高并发部署提供了实用方案。

  14. vLLM 官方博客(网页)73

    vLLM 推出分层 KV Cache 卸载框架

    vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。

    推荐理由:框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。

  15. vLLM 官方博客(网页)67

    vLLM 发布 Kimi K3 性能优化:端到端吞吐提升达 2.8 倍

    vLLM 宣布针对 Kimi K3 模型完成全栈推理性能优化,在 B300 节点 8K/1K 负载下实现端到端吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%,平均延迟降低 56%–60%。

    推荐理由:原文给出了从自适应调度、KDA 检查点到 ReplaySSM 的全栈优化细节,读者可据此参考混合架构大模型推理加速方案。

  16. vLLM 官方博客(网页)69

    vLLM 团队基于 GB300 NVL72 与 Mooncake 训练 Kimi K3 的 DSpark 投机草稿模型

    vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。

    推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。