跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

168条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 101–120 条 · 共 168 条
9月22日周二
  1. vLLM 更新76

    推理框架 vLLM 发布 v0.30.0 版本

    推理框架 vLLM 正式发布 v0.30.0 版本,新增对 DeepSeek-V4.1-Flash、GLM-5.3-Flash 等新架构模型的端到端支持。核心更新引入支持 FP4 与多机 TP 的 Fast Start 显存权重缓存守护进程,大幅缩短引擎重启与初始化耗时;同时上线 HiSparse 分层稀疏 MLA 解码机制,并深度优化了投机解码、上下文并行及 NVFP4 量化性能。

    推荐理由:该版本通过显存权重常驻守护进程与稀疏解码分层卸载,为大模型长上下文与高并发推理提供了可迁移的部署优化方案。

  2. NVIDIA Developer Blog65

    NVIDIA Dynamo-Triton 集成 TensorRT 多设备推理以简化多 GPU 模型服务

    NVIDIA 推出 TensorRT 多设备推理能力并在 Dynamo-Triton 中完成集成,旨在简化多 GPU 场景下的模型服务。该能力基于 NCCL 分布式通信集合,允许单个 TensorRT 网络跨多张 GPU 执行,同时保留 TensorRT 的推理优化性能,已自 TensorRT 11.0 起获得完整支持。

    推荐理由:原文介绍了基于 NCCL 的多 GPU 分布式推理新特性,读者可据此了解 TensorRT 11.0 的多卡部署优化机制。

  3. Engineering at Meta72

    Meta 开源超大规模资源分配求解库 Rebalancer

    Meta 宣布以 Apache 2.0 协议开源已在内部运行超 9 年的高性能分配问题求解库 Rebalancer。该库将问题规范与求解逻辑解耦,支持通过表达式图接入 MIP 求解器或高度并行优化的局部搜索算法,在 Meta 内部每天求解约 4000 万个涉及硬件放置、任务调度及 ML 训练负载均衡的问题。

    推荐理由:Meta 开源了在内部支撑九年超大规模基础设施调度的通用求解库,为海量算力与数据中心资源分配提供了可迁移的高性能解法。

9月21日周一
  1. Hugging Face72

    Hugging Face 发布 tokenizers v1 候选版,编码吞吐提速 3 至 30 倍

    Hugging Face 推出分词库 tokenizers v1 发布候选版,在保持输出 token ID、词表与 API 完全兼容的前提下,单线程编码速度相比 v0.23 提升 3 至 30 倍。

    推荐理由:材料详细拆解了用 SIMD 位流替代正则、内存零分配合并与词缓存等工程设计,为大并发分词系统的性能调优提供了可迁移方案。

9月18日周五
  1. AWS News · 云基础设施64

    Amazon EC2 T8i 突发性能实例正式上线

    AWS 宣布 Amazon EC2 T8i 突发性能实例正式可用,搭载定制第六代 Intel Xeon 可扩展处理器(Granite Rapids),相比上一代 T3 实例性价比最高提升 30%。

    推荐理由:原文给出了 T8i 实例的详细规格与性能对比,开发者可以据此评估低负载工作流向新一代突发实例迁移的性价比。

9月17日周四
  1. AWS News · 云基础设施77

    AWS 重塑开发者起步体验:支持第三方登录并适配编码智能体

    AWS 推出面向 AI 开发者的全新简化入门体验,支持使用 Google、GitHub 或 Apple 账号免信用卡直接注册,并提供 100 美元免费额度。系统以项目方式自动隔离权限与成员协作,开发者可直接将配置提示词接入编码智能体,由其自动部署资源并管理底层权限,当业务扩展时可无缝激活完整 AWS 高级功能。

    推荐理由:AWS通过免信用卡登录、自动分配权限以及与编码智能体对接,大幅降低了云端部署基础设施的起步门槛。

9月16日周三
  1. NVIDIA · AI 筛选76

    NVIDIA Vera Rubin NVL72 首度亮相 MLPerf Inference v6.1 评测

    NVIDIA 在 MLPerf Inference v6.1 预览评测中展示了 Vera Rubin NVL72 系统,在 Qwen3-VL 任务上的吞吐量达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上的吞吐量最高达到 2.5 倍。

    推荐理由:原文通过实测基准数据对比了新一代架构在长上下文与多模态模型上的吞吐与扩展效率,便于评估大模型推理基础设施的代际演进。

9月11日周五
9月10日周四
  1. The Next Platform72

    d-Matrix 与 Nvidia 达成合作:将存算一体芯片 Raptor XPU 接入 NVL144 MGX 机架

    AI 推理芯片初创公司 d-Matrix 宣布与 Nvidia 达成合作,将其基于 3D-RAM 的下一代推理芯片 Raptor XPU 接入 Nvidia MGX 架构与 NVL144 液冷机架。

    推荐理由:存算一体芯片通过接入主流机架与高速互连架构降低落地门槛,为高并发低延迟的生成式推理提供了机架级异构部署参考。

  2. 月之暗面 Kimi 公众号64

    Kimi 启动企业合作伙伴计划,联合集成商共建 FDE 推进企业级落地

    Kimi 正式启动企业合作伙伴计划,与 IT 服务商及系统集成商共建前线部署工程师(FDE)队伍,推动模型能力与 Agent 底座深入客户现场完成生产级交付。首批签约伙伴包括华胜天成、金山云、亚康股份、亚信科技和中软国际,重点应对数据不出域、系统私有化与算力适配等落地难题。Kimi 将提供模型能力、Hosted Agents 运行底座与工程师培训认证,利用一线场景认知反哺模型研发闭环。

    推荐理由:原文展现了模型厂商借力传统系统集成商与 FDE 模式切入政企核心业务的路径,读者可借此评估大模型商业落地的交付分工。

  3. Hugging Face70

    Hugging Face 展示基于 Storage Bucket 与代理的跨节点 LoRA 异步 GRPO 训练实践

    Hugging Face 在 TRL v1.14 中为 AsyncGRPOTrainer 增加了 LoRA 适配器同步支持,使训练节点与 vLLM 推理副本无需跨机 NCCL 即可跨节点独立运行。

    推荐理由:原文展示了无需 NCCL 跨机通信的异步 GRPO 架构实现与调优细节,读者可据此排查强化学习训练与推理流水线的吞吐瓶颈。

9月9日周三
  1. Kubernetes Blog70

    Kubernetes v1.37 推进工作负载感知调度:Gang Scheduling 升至 Beta 并引入多层级调度 API

    Kubernetes v1.37 正式推进工作负载感知调度,核心 Workload 与 PodGroup API(支持 Gang Scheduling)、工作负载感知抢占及 DRA 资源共享均晋升至 Beta 阶段。

    推荐理由:多层级拓扑感知调度与 PodGroup 队列机制原生落地,为大规模分布式 AI 训练与复杂批处理提供了更细粒度的协同编排能力。

9月8日周二
  1. NVIDIA Developer Blog61

    NVIDIA 推出 CUDA Rust:提供两条路径编写 GPU 内核

    NVIDIA 宣布推出 CUDA Rust,正式支持使用 Rust 语言进行原生 GPU 内核编程。继 CUDA C++ 与 CUDA Python 之后,NVIDIA 计划在 2027 年及未来持续完善 CUDA Rust 工具链,以支持推理引擎、服务基建与智能体运行时等 AI 系统层软件的开发。

    推荐理由:NVIDIA 将 GPU 内核编程拓展至 Rust 生态,为 AI 系统层与推理基础设施开发提供了新的工具选择。

9月4日周五
  1. Kubernetes Blog68

    Kubernetes v1.37 发布 DRA 动态资源分配多项更新

    Kubernetes 1.37 正式发布并更新了动态资源分配(DRA)功能,其中 DRA 扩展资源支持已晋升为 GA 稳定版。该机制允许 DRA 驱动直接响应传统 extended resource 请求(如 GPU),无需修改既有工作负载即可平滑迁移到底层 DRA 分配逻辑。

    推荐理由:原文系统梳理了 DRA 扩展资源支持晋升 GA 以及 CEL 自定义匹配等多项改进,读者可据此评估现有 GPU 等异构硬件向 DRA 架构平滑迁移的可行性。

  2. Azure Blog · 云基础设施88

    OpenAI 前沿模型 GPT-6 Astra 正式在 Microsoft Foundry 全面可用

    OpenAI 最新前沿模型 GPT-6 Astra 正式在 Microsoft Foundry 全面可用(GA),主打面向复杂企业任务的多步规划、跨应用工具调用以及计算机使用(computer use)能力。

    推荐理由:原文明确了前沿智能体模型在企业云端的部署形态与调用定价,有助于评估复杂跨应用自动化任务的落地成本与安全架构。

9月2日周三
  1. Engineering at Meta71

    Meta 介绍组织级第二大脑:构建从专家反馈中持续学习的 AI Agent 架构

    Meta 工程团队介绍了用于合规等高专业度领域的“组织第二大脑”AI Agent 架构,将领域知识与推理步骤解耦,并在无需微调模型的前提下将专家反馈自动编译为可验证的知识库更新。系统由结构化文件知识库、可组合的推理配方(Recipes)以及自动化自我改进闭环组成,使每次人工修正通过回归测试转化为永久沉淀;落地实践将单次评估时间从数天缩短至数分钟,且单轮 token 消耗降低约 80%。

    推荐理由:原文展示了无需微调即可将专家反馈编译为版本化知识文件的自进化 Agent 架构,为企业沉淀领域专业知识提供了可落地的工程范式。

9月1日周二
  1. 腾讯混元 公众号73

    腾讯混元发布 Hy4 preview 轻量量化版,模型权重从 1.5TB 压缩至 214GB

    腾讯混元团队推出 Hy4 preview 轻量量化版本,通过自研 Sherry 稀疏三值量化算法与 MIX-STQ1_0 逐层混合精度策略,将模型权重从接近 1.5TB 压缩至约 214GB。

    推荐理由:原文详述了自研三值量化与混合精度策略,为超大参数模型在有限与异构硬件上的本地推理提供了可迁移的工程参考。