最新精选
第 121–140 条 · 共 168 条Hugging Face 推出 @huggingface/kernels 库及首批 207 个 WebGPU 算子,旨在加速浏览器端本地 AI 推理。每个算子以独立版本化仓库发布在 Hub 上,包含接口契约、WGSL 着色器模板、正确性与基准测试用例,并同步推出了浏览器端基准测试工具 Fleet 以众包真实硬件数据。
推荐理由:Hugging Face 将 WebGPU 算子模块化管理并提供众包基准测试,有助于开发者提升端侧浏览器 AI 推理性能。
- AWS News · 云基础设施精选AI 评分7171
AWS 宣布基于自研 Graviton5 处理器的 Amazon EC2 R9g 和 R9gd 内存优化型实例正式全面可用。新实例单 vCPU 计算性能较 Graviton4 提升高达 25%,搭载 DDR5 8800 MT/s 内存与 5 倍 L3 缓存,最大规格提供 100 Gbps 网络和 72 Gbps EBS 带宽,R9gd 还附带本地 NVMe SSD 存储。
推荐理由:原文详细给出了基于Graviton5实例的硬件提升与完整规格表,便于读者评估内存型工作负载的云上迁移成本与性能增益。
- The Next Platform精选AI 评分6363
随着 Ultra Ethernet、UALink 和 ESUN 等开放标准推进,以太网正在水平和垂直扩展互联中蚕食专用协议市场,但 Nvidia 的 NVLink 与 NVSwitch 仍将在短期内主导 AI 纵向扩展网络。
推荐理由:原文通过梳理网络技术演进历史,对比了 NVSwitch 与 UALink 等开放协议在 AI 纵向扩展互联中的博弈路径。
- NVIDIA Developer Blog精选AI 评分7070
NVIDIA 推出 NVLink Fusion,将 NVHBM 引入下一代 AI 基础设施。该方案主要应对超大规模计算中心与定制 AI 加速器在运行超大模型及复杂推理任务时对高带宽内存的需求,以保障大规模扩展下的算力供给与互连效率。
推荐理由:原文介绍了面向下一代 AI 基础设施的内存互连方案,有助于了解大模型与定制加速器在带宽扩展上的架构演进。
- NVIDIA Developer Blog精选AI 评分7777
NVIDIA Developer Blog 介绍了在 NVIDIA GB300 NVL72 上运行阿里 Qwen3.8-Flash-Next 进行智能体编码的实践。
推荐理由:文章解析了在 GB300 NVL72 上运行 Qwen4 预览版模型的架构参数与长上下文特性,为开发者构建智能体编码工作流提供了参考。
腾讯混元联合英特尔与哔哩哔哩推出 Hy-MT2-1.8B 极低比特翻译模型方案,提供 2-bit(574MB)与 1.25-bit(440MB)两套量化版本,将原本 3.3GB 的端侧模型压缩至几百兆且保持翻译质量几乎无损。
推荐理由:原文展示了从量化算法、芯片指令优化到直播弹幕落地的完整链路,为端侧小模型的极致压缩与低资源部署提供了可复用实践。
- Kubernetes Blog精选AI 评分7070
Kubernetes 正式发布 v1.37 版本,共带来 67 项功能增强,其中 16 项毕业至 Stable、23 项进入 Beta、27 项进入 Alpha。
推荐理由:原文汇总了新版本全部功能演进,为针对 AI 训练与弹性算力调度的集群架构升级提供了选型参考。
AWS 团队分享了在韩国国家 AI 研究项目中为多所科研机构提供 30 台 p5en.48xlarge 实例(240 张 H200 GPU)的管理实战经验。文章详细拆解了 AWS ParallelCluster 的 cluster-config.yaml 配置要点,包括 EFA 网络开启、基于内存的调度以及容量预留锁定。
推荐理由:原文给出了多团队共享 GPU 集群时的 ParallelCluster 与 Slurm QoS 详细配置,工程团队可直接借鉴多租户调度与防资源垄断策略。
- NVIDIA Developer Blog精选AI 评分6262
NVIDIA 发布 CUDA Python 1.0,提供稳定的 API、统一基础架构以及对 CUDA 平台的完整访问能力。该版本旨在解决 Python 开发者此前要么手写 CUDA C++ 扩展、要么完全依赖 PyTorch 或 CuPy 等上层库的局限。
推荐理由:原文阐述了 CUDA Python 1.0 提供的稳定 API 与平台访问能力,有助于开发者评估如何降低 Python 调用底层 GPU 的开发门槛。
Gradio 正式推出内置工作流功能 gr.Workflow,支持开发者将 AI 流水线定义为类型化节点图,提供可运行的拖拽式画布、REST API 暴露以及一键部署到 Hugging Face Spaces 的能力。
推荐理由:介绍 Gradio 如何将多步 AI 流水线转化为可视化节点图与 REST 接口,读者可据此评估应用编排与快速部署方案。
- Engineering at Meta精选AI 评分7575
Meta 宣布推出专为百万 GPU 规模 AI 工作负载设计的 RDMA 传输协议 MetaRoCE,并通过开放计算项目(OCP)开源其完整规范、软件参考实现 libsoftmetaroce 与合规测试套件。
推荐理由:原文给出了面向百万级 GPU 的传输层设计与测试数据,读者可以据此评估在标准以太网上去除 PFC 对智算网络吞吐与弹性的提升。
- Engineering at Meta精选AI 评分8282
Meta 推出首款针对推荐与排序模型训练优化的自研 AI 芯片 MTIA 300,在芯片封装内集成了自研网卡芯粒与专用通信卸载引擎。该芯片包含 12 个 800 Gbps RDMA 网卡以提供 1.2 TB/s 的 I/O 带宽,并借助 16 个专用消息引擎使集合通信对算力吞吐的干扰降至 0.5% 以下。
推荐理由:芯片通过片上集成网卡与近存通信引擎实现通信计算完全解耦,为大规模推荐模型训练的通信瓶颈提供了硬件层面的协同设计参考。
Hugging Face 详细介绍了 Papers with Code 的混合检索架构设计,结合 PostgreSQL 全文检索与 pgvector 语义向量检索管理超过 11 万篇论文。
推荐理由:原文详细拆解了离线全量构建与在线低延迟检索解耦的系统设计,为向量与全文混合搜索落地提供了可复用的工程参考。
- The Next Platform精选AI 评分6060
Cerebras 正式推出代号为 Nexus 的 CS-4 系统,搭载超频版 WSE-3 Turbo 晶圆级引擎,通过两倍供电与增强散热将芯片算力与吞吐提升至前代的 2 倍。
推荐理由:文章解析了 CS-4 如何通过超频 WSE-3 芯片与背包式解耦机架设计,在不更换底层晶圆制程的前提下实现单机吞吐与部署效率的翻倍。
Dharma AI 构建了一种约束感知 GPU 调度分配器,在硬件与工作负载完全相同的情况下,相比传统先进先出(FIFO)调度将 GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。
推荐理由:文章详细拆解了混合负载下约束感知调度与需求预测的设计方法,为算力集群提升利用率提供了可落地的工程思路。
Hugging Face 发布 2026 年夏季开源模型生态报告,指出开源模型呈现关注度与实际工程落地脱节的特征,千问已成为社区最核心的基础底座。报告数据显示,平台 83% 的历史下载量集中在 1B 以下小模型,中国团队在 754B 至 2.78T 超大参数开源模型上持续领跑,主要依靠 llama.cpp 等 GGUF 本地推理工具实现社区分发。
推荐理由:报告通过平台下载与点赞数据揭示了开源大模型关注度与实际工程落地的脱节,为开发者技术选型提供了客观参考。
Hugging Face 与 AWS 联合展示了通过 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人端到端流式数据闭环的方法。
推荐理由:原文给出了基于 Storage Buckets 增量去重与流式读取的端到端机器人闭环实践,读者可据此降低具身智能数据传输与存储开销。
- Engineering at Meta精选AI 评分6666
Meta 详细介绍了 WhatsApp 正在测试的防诈预警功能 Scam Alert 的技术架构。该功能完全在端侧运行轻量机器学习模型以识别潜在诈骗消息,所有消息内容均不出设备且不进行自动上报。系统通过基于 TEE 的机密联邦分析管道收集带差分隐私噪声的聚合指标,并借助第三方透明账本与 OHTTP 中继确保模型下发与分析流程公开可验证且无法针对特定用户定向投递。
推荐理由:文章详细公开了如何在端到端加密场景下结合端侧模型与机密计算构建兼顾隐私与可验证性的系统方案。
- The Next Platform精选AI 评分7272
NVIDIA 发布面向常驻 AI 智能体工作流的开源模型 Nemotron 3.5 Lightning,以及用于动态调度多模型的 NeMo Switchyard 路由库。
推荐理由:原文对比了新模型与前代规格的性能和延迟差异,并展示了如何通过配套路由库在复杂智能体工作流中平衡成本与响应速度。
NVIDIA 推出 364M 参数的开源多语言文本转语音模型 Magpie TTS Multilingual,开放模型权重并提供生产就绪的 NIM 推理微服务。
推荐理由:模型开源权重并提供生产级推理微服务,帮助开发者在私有基础设施上自控语音延迟预算与定制发音。