跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

168条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–140 条 · 共 168 条
9月1日周二
  1. Hugging Face73

    Hugging Face 推出 @huggingface/kernels 与 200+ WebGPU 算子库

    Hugging Face 推出 @huggingface/kernels 库及首批 207 个 WebGPU 算子,旨在加速浏览器端本地 AI 推理。每个算子以独立版本化仓库发布在 Hub 上,包含接口契约、WGSL 着色器模板、正确性与基准测试用例,并同步推出了浏览器端基准测试工具 Fleet 以众包真实硬件数据。

    推荐理由:Hugging Face 将 WebGPU 算子模块化管理并提供众包基准测试,有助于开发者提升端侧浏览器 AI 推理性能。

  2. AWS News · 云基础设施71

    基于 AWS Graviton5 处理器的 Amazon EC2 R9g 与 R9gd 实例正式全面可用

    AWS 宣布基于自研 Graviton5 处理器的 Amazon EC2 R9g 和 R9gd 内存优化型实例正式全面可用。新实例单 vCPU 计算性能较 Graviton4 提升高达 25%,搭载 DDR5 8800 MT/s 内存与 5 倍 L3 缓存,最大规格提供 100 Gbps 网络和 72 Gbps EBS 带宽,R9gd 还附带本地 NVMe SSD 存储。

    推荐理由:原文详细给出了基于Graviton5实例的硬件提升与完整规格表,便于读者评估内存型工作负载的云上迁移成本与性能增益。

  3. The Next Platform63

    从长远看 Nvidia NVSwitch 将成为 AI 纵向扩展网络的 InfiniBand

    随着 Ultra Ethernet、UALink 和 ESUN 等开放标准推进,以太网正在水平和垂直扩展互联中蚕食专用协议市场,但 Nvidia 的 NVLink 与 NVSwitch 仍将在短期内主导 AI 纵向扩展网络。

    推荐理由:原文通过梳理网络技术演进历史,对比了 NVSwitch 与 UALink 等开放协议在 AI 纵向扩展互联中的博弈路径。

8月27日周四
  1. NVIDIA Developer Blog70

    NVIDIA 推出 NVLink Fusion 将 NVHBM 引入下一代 AI 基础设施

    NVIDIA 推出 NVLink Fusion,将 NVHBM 引入下一代 AI 基础设施。该方案主要应对超大规模计算中心与定制 AI 加速器在运行超大模型及复杂推理任务时对高带宽内存的需求,以保障大规模扩展下的算力供给与互连效率。

    推荐理由:原文介绍了面向下一代 AI 基础设施的内存互连方案,有助于了解大模型与定制加速器在带宽扩展上的架构演进。

8月26日周三
  1. 腾讯混元 公众号65

    腾讯混元发布 Hy-MT2-1.8B 极低 bit 翻译模型,将 3.3GB 模型压缩至 440MB 并落地直播弹幕

    腾讯混元联合英特尔与哔哩哔哩推出 Hy-MT2-1.8B 极低比特翻译模型方案,提供 2-bit(574MB)与 1.25-bit(440MB)两套量化版本,将原本 3.3GB 的端侧模型压缩至几百兆且保持翻译质量几乎无损。

    推荐理由:原文展示了从量化算法、芯片指令优化到直播弹幕落地的完整链路,为端侧小模型的极致压缩与低资源部署提供了可复用实践。

  2. AWS HPC63

    基于 AWS ParallelCluster 管理大规模大语言模型训练环境实战

    AWS 团队分享了在韩国国家 AI 研究项目中为多所科研机构提供 30 台 p5en.48xlarge 实例(240 张 H200 GPU)的管理实战经验。文章详细拆解了 AWS ParallelCluster 的 cluster-config.yaml 配置要点,包括 EFA 网络开启、基于内存的调度以及容量预留锁定。

    推荐理由:原文给出了多团队共享 GPU 集群时的 ParallelCluster 与 Slurm QoS 详细配置,工程团队可直接借鉴多租户调度与防资源垄断策略。

8月25日周二
  1. NVIDIA Developer Blog62

    CUDA Python 1.0 发布:提供稳定 API 与底层平台完整访问能力

    NVIDIA 发布 CUDA Python 1.0,提供稳定的 API、统一基础架构以及对 CUDA 平台的完整访问能力。该版本旨在解决 Python 开发者此前要么手写 CUDA C++ 扩展、要么完全依赖 PyTorch 或 CuPy 等上层库的局限。

    推荐理由:原文阐述了 CUDA Python 1.0 提供的稳定 API 与平台访问能力,有助于开发者评估如何降低 Python 调用底层 GPU 的开发门槛。

  2. Hugging Face73

    Gradio 推出 gr.Workflow 工作流编排功能

    Gradio 正式推出内置工作流功能 gr.Workflow,支持开发者将 AI 流水线定义为类型化节点图,提供可运行的拖拽式画布、REST API 暴露以及一键部署到 Hugging Face Spaces 的能力。

    推荐理由:介绍 Gradio 如何将多步 AI 流水线转化为可视化节点图与 REST 接口,读者可据此评估应用编排与快速部署方案。

  3. Engineering at Meta75

    Meta 开源 MetaRoCE:专为大规模 AI 以太网设计的 RDMA 传输协议

    Meta 宣布推出专为百万 GPU 规模 AI 工作负载设计的 RDMA 传输协议 MetaRoCE,并通过开放计算项目(OCP)开源其完整规范、软件参考实现 libsoftmetaroce 与合规测试套件。

    推荐理由:原文给出了面向百万级 GPU 的传输层设计与测试数据,读者可以据此评估在标准以太网上去除 PFC 对智算网络吞吐与弹性的提升。

  4. Engineering at Meta82

    Meta 推出首款内置网卡与通信卸载引擎的训练芯片 MTIA 300

    Meta 推出首款针对推荐与排序模型训练优化的自研 AI 芯片 MTIA 300,在芯片封装内集成了自研网卡芯粒与专用通信卸载引擎。该芯片包含 12 个 800 Gbps RDMA 网卡以提供 1.2 TB/s 的 I/O 带宽,并借助 16 个专用消息引擎使集合通信对算力吞吐的干扰降至 0.5% 以下。

    推荐理由:芯片通过片上集成网卡与近存通信引擎实现通信计算完全解耦,为大规模推荐模型训练的通信瓶颈提供了硬件层面的协同设计参考。

8月21日周五
  1. Hugging Face64

    Hugging Face 如何利用 Endpoints、Jobs 和 Buckets 构建 Papers with Code 混合搜索引擎

    Hugging Face 详细介绍了 Papers with Code 的混合检索架构设计,结合 PostgreSQL 全文检索与 pgvector 语义向量检索管理超过 11 万篇论文。

    推荐理由:原文详细拆解了离线全量构建与在线低延迟检索解耦的系统设计,为向量与全文混合搜索落地提供了可复用的工程参考。

8月19日周三
  1. The Next Platform60

    Cerebras 发布 Nexus CS-4 算力系统:搭载超频版 WSE-3 晶圆级芯片提升推理性能

    Cerebras 正式推出代号为 Nexus 的 CS-4 系统,搭载超频版 WSE-3 Turbo 晶圆级引擎,通过两倍供电与增强散热将芯片算力与吞吐提升至前代的 2 倍。

    推荐理由:文章解析了 CS-4 如何通过超频 WSE-3 芯片与背包式解耦机架设计,在不更换底层晶圆制程的前提下实现单机吞吐与部署效率的翻倍。

8月18日周二
  1. Hugging Face63

    Dharma AI 提出约束感知 GPU 调度方案:同集群利用率最高提升 33 个百分点

    Dharma AI 构建了一种约束感知 GPU 调度分配器,在硬件与工作负载完全相同的情况下,相比传统先进先出(FIFO)调度将 GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。

    推荐理由:文章详细拆解了混合负载下约束感知调度与需求预测的设计方法,为算力集群提升利用率提供了可落地的工程思路。

8月14日周五
  1. Hugging Face80

    Hugging Face 发布 2026 年夏季开源模型报告:千问成为主流基座,小模型与端侧工具主导实际落地

    Hugging Face 发布 2026 年夏季开源模型生态报告,指出开源模型呈现关注度与实际工程落地脱节的特征,千问已成为社区最核心的基础底座。报告数据显示,平台 83% 的历史下载量集中在 1B 以下小模型,中国团队在 754B 至 2.78T 超大参数开源模型上持续领跑,主要依靠 llama.cpp 等 GGUF 本地推理工具实现社区分发。

    推荐理由:报告通过平台下载与点赞数据揭示了开源大模型关注度与实际工程落地的脱节,为开发者技术选型提供了客观参考。

  2. Hugging Face66

    借助 Strands Agents、LeRobot 与 Hugging Face Storage Buckets 实现机器人数据采集、训练与部署闭环

    Hugging Face 与 AWS 联合展示了通过 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人端到端流式数据闭环的方法。

    推荐理由:原文给出了基于 Storage Buckets 增量去重与流式读取的端到端机器人闭环实践,读者可据此降低具身智能数据传输与存储开销。

8月12日周三
  1. Engineering at Meta66

    Meta 解读 WhatsApp 如何在端到端加密下构建防诈预警功能 Scam Alert

    Meta 详细介绍了 WhatsApp 正在测试的防诈预警功能 Scam Alert 的技术架构。该功能完全在端侧运行轻量机器学习模型以识别潜在诈骗消息,所有消息内容均不出设备且不进行自动上报。系统通过基于 TEE 的机密联邦分析管道收集带差分隐私噪声的聚合指标,并借助第三方透明账本与 OHTTP 中继确保模型下发与分析流程公开可验证且无法针对特定用户定向投递。

    推荐理由:文章详细公开了如何在端到端加密场景下结合端侧模型与机密计算构建兼顾隐私与可验证性的系统方案。

8月11日周二