跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

168条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 81–100 条 · 共 168 条
9月30日周三
  1. vLLM 官方博客(网页)64

    vLLM 集成 PyNvVideoCodec 硬件视频解码以提升多 GPU 视频处理吞吐

    vLLM 宣布集成 PyNvVideoCodec 以支持 NVIDIA GPU 硬件视频解码(NVDEC),将视频解码工作负载从 CPU 转移至专用硬件。该方案消除了多 GPU 节点运行视觉语言模型时 CPU 易满载的瓶颈,在 8×H100 配置下使视频描述任务的吞吐量达到 CPU 解码方案的两倍以上。

    推荐理由:通过将视频解码从 CPU 卸载至 GPU 硬件解码器,解决了多卡视觉模型推理中的预处理瓶颈并给出了部署配置参考。

  2. vLLM 官方博客(网页)65

    vLLM 详解 Qwen3.8-2.4T 的 PD 分离推理优化实践

    vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。

    推荐理由:文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。

  3. vLLM 官方博客(网页)78

    vLLM 推出 vllm-metal:支持 Apple Silicon 的并发推理服务栈

    vLLM 官方发布 vllm-metal,将 vLLM 的 V1 调度器、分页 KV 缓存和连续批处理服务栈引入 Apple Silicon,底层结合 MLX 与 Metal 执行。

    推荐理由:原文给出了将 vLLM 分页调度栈移植到 Apple Silicon 的架构与内核实现,读者可以据此评估 Mac 本地多智能体并发推理的性能与部署方案。

  4. vLLM 官方博客(网页)66

    深入解析 vLLM:高吞吐大语言模型推理系统的架构剖析

    vLLM 官方博客发布技术长文深度剖析其 V1 推理引擎,系统拆解从单卡底层内核到大规模分布式服务的完整架构。文章详细解读了调度器运行机制、PagedAttention 内存分配与连续批处理流程,并深入探讨分块 Prefill、前缀缓存、基于有限状态机的引导解码、推测解码以及 Prefill/Decode 分离等高级特性。

    推荐理由:文章从单机引擎内核层层拆解到多节点分布式服务,为理解和优化高吞吐大模型推理系统提供了完整清晰的架构参考。

  5. Google Developers · AI 筛选63

    Google 基于 MaxText 与 TPU 完整复现 Olmo 3 7B 预训练流程

    Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。

    推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。

  6. Ollama 更新72

    Ollama v0.35.0 发布:新增决策模型接口与概率评分输出

    Ollama 发布 v0.35.0 版本,通过 /v1/systemone 接口新增对决策模型的支持。该功能基于 TypeSafe 的 Jev API,使模型直接返回选项、概率和分值而非生成文本,适用于工单分拣、模型路由和内容分类等场景,首批支持 Nimble 和 Tev1 模型。新版本还修复了 MLX 模型下载挂起的问题,并优化了设置加载与已弃用参数的告警处理。

    推荐理由:原文给出了决策模型的调用接口与结构化返回示例,展示了本地运行时从文本生成拓展至精准分类与路由的能力。

9月29日周二
  1. Cloudflare Blog · 网络基础设施60

    Cloudflare 使用前沿 AI 模型实测自家 WAF:1107 次攻击变异与规则加固

    Cloudflare 使用前沿大语言模型构建双模型自适应循环,在黑盒环境下对自家 WAF 展开动态渗透与变异载荷测试。测试覆盖 XSS、SQLi、CMDi、SSRF、LFI 和 Log4j 等 6 类攻击共 1,107 次尝试,人工筛查后确认 49 个主要集中于 CMDi 和 SSRF 的有效防御缺口。

    推荐理由:Cloudflare 详述了利用大模型动态变异载荷测试 WAF 的闭环框架,为安全团队探索 AI 辅助渗透与防御加固提供了可落地的工程实践。

9月28日周一
  1. CNCF Blog71

    Stacklok 开源云原生 Agent 框架 Mecatl

    Stacklok 宣布开源云原生 AI 智能体框架 Mecatl,将核心 Agent 循环与客户端、执行环境、工具系统及会话存储解耦,支持在 Kubernetes 等分布式环境中弹性部署与滚动更新。

    推荐理由:文章阐述了将智能体运行循环与执行环境和会话存储解耦的云原生架构设计,为大规模多租户部署提供了工程参考。

  2. Cloudflare Blog · 网络基础设施69

    Cloudflare 2026 年度创始人公开信:自动化流量已超人类流量,AI 智能体正重塑网络生态

    Cloudflare 联合创始人 Matthew Prince 发布 2026 年度公开信,指出在 AI 智能体与爬虫推动下,自动化网络流量已在 2026 年 5 月超越人类流量,并预计未来 5 年内达到人类流量的 1000 倍。

    推荐理由:原文基于平台数据揭示了自动化流量已超人类流量的转折点,读者可据此理解智能体普及对网络生态与流量成本的影响。

9月26日周六
  1. ServeTheHome71

    AMD 披露下一代 EPYC 9006 Venice 服务器处理器细节:基于 Zen 6 架构与台积电 2nm 制程

    AMD 公布了代号 Venice 的下一代 EPYC 9006 系列服务器 CPU 规划,全系采用 Zen 6 架构与台积电 2nm 制程。Zen 6c 高密度版本最高配备 256 核与 1024MB L3 缓存,高频 Zen 6 版本最高达 96 核与 5.0GHz 频率,顶级型号 TDP 上升至 600W。

    推荐理由:文章详细拆解了 Zen 6 系列处理器的核心规格与双 IOD 设计,读者可据此了解服务器平台在内存带宽与异构互联上的演进路径。

9月25日周五
  1. Ollama 更新69

    Ollama v0.40.0 发布:Apple Silicon 设备默认采用 MLX 运行时

    Ollama 发布 v0.40.0 预发布版本,在 Apple Silicon 设备上默认通过 MLX 运行时加载并运行受支持的模型架构。团队在预发布期间将持续测试并启用更多模型架构,支持通过标准命令拉取和运行 Qwen3.8 等模型。

    推荐理由:Ollama 在苹果芯片上默认启用 MLX 后端,读者可据此了解本地模型在 Mac 上的推理路径变化与适配规划。

9月24日周四
  1. Engineering at Meta67

    Meta 为 AI 眼镜引入机密计算基础设施 Private Processing

    Meta 宣布将机密计算基础设施 Private Processing 扩展至 Meta AI 眼镜,把眼镜端的信任边界延伸至云端机密虚拟机(CVM),确保即使处理高负载 AI 任务,Meta 也无法访问用户数据。

    推荐理由:原文给出了 AI 眼镜在端云协同中兼顾长期记忆与机密计算的架构设计,有助于了解端侧智能硬件在云端大模型算力卸载时的隐私安全方案。

  2. Microsoft Research63

    微软推出具身智能推理云边卸载方案并上线工具集

    微软研究院针对物理具身智能(Physical AI)推出推理卸载方案与工具集,指出将 AI 推理从机器人板载 GPU 卸载至边缘或云端可显著突破算力瓶颈并延长续航。

    推荐理由:原文系统量化了机器人端侧与云边协同推理的性能与能耗权衡,为具身智能系统的分布式算力架构设计提供了实测参考。

  3. Google DeepMind62

    Google 为 Private AI Compute 引入服务端安全记忆架构

    Google 宣布为其 Private AI Compute 平台升级安全服务端记忆能力,使 AI 助手在保持设备端隐私标准的同时具备跨设备的持久上下文。该方案将解密密钥完全保留在用户设备端,云端安全隔离区仅在处理请求时于隔离内存中临时解密数据,完成计算后立即重新加密存储。Google 同步公开了服务端软件的防篡改记录与第三方独立审计结果以供外部验证。

    推荐理由:该架构通过设备端掌握密钥与云端安全隔离区结合,解决了跨设备长期记忆与隐私保护难以兼顾的工程矛盾。

9月23日周三
  1. AWS News · 云基础设施75

    AWS 推出 Amazon CloudWatch Omni 为生成式 AI 与智能体提供专用可观测性

    AWS 正式推出 Amazon CloudWatch Omni,为生成式 AI 和 AI 智能体工作负载提供跨模型与框架的统一可观测、评估及实验方案。该方案提供 VS Code 与 Kiro 原生 IDE 插件以及独立 Web 界面,内置 17 种评估指标,支持分步追踪 LLM 与工具调用、提示词版本对比及自动化回归测试。IDE 插件免费提供且支持纯本地开发,无需 AWS 账号即可开始使用。

    推荐理由:AWS 将智能体追踪与评估能力内嵌到 IDE 和独立 Web 界面中,让开发者无需登录控制台即可排查非确定性调用问题。

  2. OpenAI 官方动态68

    GPT-6 优化提示词缓存:提升命中率并降低延迟与成本

    OpenAI 介绍了 GPT-6 提示词缓存(prompt caching)的改进机制。该功能通过提高缓存命中率、增加新诊断工具、支持显式断点及控制项,帮助开发者降低模型调用的延迟和成本。

    推荐理由:原文介绍了提示词缓存机制的具体改进方向,读者可以据此评估其对降低调用成本和延迟的作用。

  3. The Next Platform64

    向量搜索已演进为常规数据类型,但背后的内存与架构成本并未消失

    独立向量数据库正快速被 Postgres、Elasticsearch、ClickHouse 等通用引擎的内建 ANN 索引取代,但向量检索的底层内存成本与硬件物理限制并未改变。

    推荐理由:文章拆解了向量检索内嵌后的真实内存与吞吐成本曲线,为技术团队在自建索引与托管服务之间权衡提供了具体参考。