跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

168条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 21–40 条 · 共 168 条
9月30日周三
  1. Cerebras 官方博客(网页)82

    Cerebras CS-3 接入 AWS 数据中心,联合推出 Trainium 分离式推理架构

    Cerebras 宣布 AWS 正在其数据中心部署 Cerebras CS-3 系统,后续将通过 AWS Bedrock 提供开源大语言模型与 Amazon Nova 系列的高速推理服务。

    推荐理由:双方通过将Prefill与Decode解耦至不同硬件,为大吞吐量智能体编码等高速推理场景提供了新的软硬件协同方案。

  2. Cerebras 官方博客(网页)72

    Cerebras 解读解耦推理:拆分 Prefill 与 Decode 重塑大模型推理架构

    Cerebras 阐述了大模型解耦推理架构,将算力密集的 Prefill 阶段与内存带宽受限的 Decode 阶段拆分至不同硬件独立运行。

    推荐理由:文章系统阐述了将大模型推理的 Prefill 与 Decode 阶段解耦运行的技术原理,展示了异构硬件协同提升吞吐与降低尾部延迟的路径。

  3. Cerebras 官方博客(网页)62

    Cerebras 与 Cognition 合作案例:为 Windsurf 搭载的 SWE-1.6 智能体提供高速推理支持

    Cognition 选用 Cerebras 推理平台为其软件工程模型 SWE-1.6 以及 SWE-grep 子智能体提供算力支持,在 Windsurf 的 Fast 档位中实现了最高 950 tokens/s 的生成速度。

    推荐理由:文章展示了模型层与硬件推理层协同优化的落地数据,读者可借此了解高速推理对编程智能体交互体验的具体提升。

  4. Cerebras 官方博客(网页)65

    Cerebras 推出 Kimi K2.6 万亿参数企业级推理服务

    Cerebras 宣布面向企业客户测试开放万亿参数开源模型 Kimi K2.6 的高速推理服务。经 Artificial Analysis 独立实测,Cerebras 运行 K2.6 的生成速度达每秒 981 个 output tokens,针对 10k 输入加 500 输出的复杂请求总耗时仅 5.6 秒,比官方接口快 29 倍。

    推荐理由:原文给出了万亿参数模型在晶圆级硬件上的实测吞吐与端到端延迟对比,读者可据此评估高速推理对智能体编码工作流的提速幅度。

  5. Cerebras 官方博客(网页)69

    Cerebras 推理平台上线 Gemma 4 31B 多模态模型

    Cerebras 宣布在其推理平台上推出 Google DeepMind 开源模型 Gemma 4 31B,以超过 1,800 tokens per second(第三方测得 1,851 TPS)的吞吐运行,成为该晶圆级计算平台首个支持图像理解的多模态模型。

    推荐理由:原文给出了 1,851 tokens per second 的多模态推理吞吐与首 token 延迟数据,读者可据此评估极速视觉智能体工作流的落地可行性。

  6. vLLM 官方博客(网页)62

    vLLM 发布 Speculators v0.5.0:支持 DFlash 算法与统一在线离线训练

    vLLM 发布投机采样训练框架 Speculators v0.5.0,引入 DFlash 块扩散算法并统一了在线与离线训练流程。DFlash 采用非因果注意力与锚点位置机制,在单次前向传播中生成整块草稿 token,在 Gemma 4 31B 评测中取得了低于 Eagle 3 的 token 间延迟。

    推荐理由:材料详细介绍了单次前向传播生成草稿词的机制与训练解耦方案,为大模型推理加速与投机采样落地提供了参考路径。

  7. LlamaIndex 官方博客(网页)66

    LlamaIndex 详解 AI 文档抽取难题:为何 Schema 才是导致流水线失效的关键

    LlamaIndex 发布文章指出,生产级 AI 文档抽取流水线的准确率瓶颈已从 OCR 与解析能力转向 Schema 定义层,未受审计的 Schema 会导致模型在必填字段上生造数据或错误合并重复项。

    推荐理由:文章拆解了文档抽取中 Schema 设计不当导致的隐性错误,提供了字段审计与 Agentic 架构的具体实践路径。

  8. vLLM 官方博客(网页)60

    NVIDIA DGX Spark 运行 vLLM 的架构配置与本地评测指南

    vLLM 官方博客解析了在基于 GB10 芯片的 NVIDIA DGX Spark 上进行本地大模型推理的架构适配与配置方案。针对 128 GB 统一内存特性,系统需要通过限制并发与预留内存来平衡系统运行,并借助 Paged KV cache 与连续批处理保证交互响应。

    推荐理由:文章给出了统一内存架构下本地大模型推理的关键参数与实测数据,为桌面端算力硬件部署提供了可复现的调优参考。

  9. vLLM 官方博客(网页)62

    vLLM-Omni 集成 Intel AutoRound 量化算法加速多模态推理

    vLLM-Omni 宣布集成 Intel 的 AutoRound 训练后量化算法,支持在 Intel XPU 和 NVIDIA GPU 上对多模态 Omni、扩散视频及图像生成模型进行 W4A16 量化推理。

    推荐理由:原文给出了端到端离线量化与直接部署的工作流及实测数据,读者可以据此评估多模态与扩散模型在低显存环境下的推理部署方案。

  10. LlamaIndex 官方博客(网页)60

    视觉语言模型为何难以解析表单:LlamaIndex 剖析核心痛点与结构化方案

    LlamaIndex 发文分析了通用视觉语言模型(VLM)在解析表单时的核心局限,指出表单包含复杂的嵌套层级与控件关联,通用模型极易在复选框状态识别、边界框定位及字段归因中出错。团队介绍了 LlamaParse 采用的树形 JSON 数据结构,并结合专用的复选框状态分类器与边界框检测模型来保证审计追溯能力。目前该表单解析增强功能已在 LlamaCloud 的相关服务档位中开放配置调用。

    推荐理由:文章详细剖析了通用视觉模型在表单识别中的多类隐蔽失效模式,为复杂文档与数据抽取提供了针对性的结构化处理方案。

  11. vLLM 官方博客(网页)67

    vLLM 推出会话感知智能体路由 SAAR,优化长流程 Agent 模型调度与缓存成本

    vLLM 在 Semantic Router 中正式引入会话感知智能体路由 SAAR,通过会话级状态控制解决长流程 Agent 在单轮 prompt 路由下易打断工具调用与丢失前缀缓存的问题。

    推荐理由:原文针对长流程智能体多轮调度痛点,提出结合工具循环锁与前缀缓存定价的会话级路由策略,为大模型推理网关降本与连续性保障提供了工程参考。

  12. vLLM 官方博客(网页)64

    vLLM 联合 DeepLearning.AI 推出大语言模型高效推理实战课程

    vLLM 联合 Red Hat 与吴恩达创办的 DeepLearning.AI 推出免费实战课程《Fast & Efficient LLM Inference with vLLM》,讲解大语言模型推理优化、部署及基准评测全流程。

    推荐理由:课程系统串联了模型量化、vLLM 服务部署与压测评估的全流程,适合需要掌握大语言模型推理优化与工程落地的开发者参考。

  13. vLLM 官方博客(网页)82

    vLLM 宣布首发支持 NVIDIA Nemotron 3 Ultra 推理

    vLLM 正式宣布为开源模型 NVIDIA Nemotron 3 Ultra 提供首发推理支持,支持通过 OpenAI 兼容 API 提供服务。Nemotron 3 Ultra 拥有 550B 总参数量与 55B 激活参数,采用 Transformer-Mamba 混合 MoE 架构,支持最高 1M tokens 上下文及 NVFP4 与 BF16 精度。

    推荐理由:原文提供了模型规格与完整的服务启动配置,开发者可以据此在多卡集群上快速部署该长程推理模型。

  14. vLLM 官方博客(网页)72

    vLLM Semantic Router v0.3 Themis 发布:引入会话感知路由与规范配置契约

    vLLM 官方发布 Semantic Router v0.3 Themis,将语义路由升级为状态化、可观测的生产级控制平面。该版本统一了本地、控制台与 Kubernetes 的 v0.3 规范配置契约,推出支持工具循环硬锁定与路由器会话记忆的会话感知智能体路由(SAAR),并新增将原始信号规范化为决策策略的 Projection 机制。

    推荐理由:材料系统梳理了语义路由器从信号到决策的流水线设计与状态化路由机制,为多模型调度与生产级推理网关架构提供了完整参考。

  15. vLLM 官方博客(网页)74

    vLLM 原生支持扩散大语言模型 DiffusionGemma

    vLLM 宣布原生支持基于 Gemma4 构建的 26B 离散扩散大语言模型 DiffusionGemma,成为该框架首个原生接入的 dLLM。实现上通过 Model Runner V2 的 ModelState 抽象管理逐请求状态,复用投机解码路径与动态序列级因果注意力,支持单批次内自回归与双向去噪混合处理。

    推荐理由:原文详述了利用 ModelState 抽象与投机解码路径接入扩散大模型的技术方案,为非自回归推理服务提供了工程实践参考。

  16. vLLM 官方博客(网页)76

    vLLM 首发支持 MiniMax M3:实现 1M 上下文多模态稀疏注意力推理

    vLLM 宣布首发支持 MiniMax M3 的 BF16 与 MXFP8 检查点,提供 1M token 上下文的原生多模态推理服务。该方案针对 MiniMax 稀疏注意力(MSA)设计了 128-token 粒度的分块预填充与解码算子,集成 EAGLE3 投机解码及工具与思考解析器。

    推荐理由:文章给出了稀疏注意力算子实现、投机解码调优及软硬件启动参数,为百万长上下文多模态模型的低延迟上线提供了具体参考。