跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

161条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 1–20 条 · 共 161 条
今天9月30日周三
  1. DeepSeek 公众号84

    DeepSeek 开源面向华为昇腾的基础设施组件

    DeepSeek 正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 语言编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA 与 DeepSelect 等计算与通信库。所有组件与此前面向英伟达平台的开源组件一一对应,并结合昇腾 Ascend C 底层指令提供高性能算子实现;双方还合作推进了基于昇腾 950 的 128 卡超节点方案。

    推荐理由:DeepSeek 将此前验证过的核心算子与通信组件移植至昇腾,为开发者在国产芯片上构建高性能训练环境提供了可直接复用的基础设施。

  2. Cloudflare Blog · 网络基础设施77

    Cloudflare 重构 Containers 沙箱架构:启动提速 6 倍并支持运行时规格选择与快照

    Cloudflare 宣布重构 Cloudflare Containers 运行时与调度策略,针对 AI 智能体工作负载全面优化沙箱能力。新推出的 durable_object 调度策略将中位数启动时间缩短至 648 毫秒,允许应用在运行时通过代码动态指定镜像与计算规格,并上线了用于保存与恢复工作区状态的文件系统快照公测版。

    推荐理由:平台展示了如何通过将容器控制权下放至持久化对象来消除冷启动延迟与静态部署限制,为构建长会话智能体沙箱提供了架构参考。

  3. Cloudflare Blog · 网络基础设施73

    Cloudflare AI Gateway 推出 Auto Router 智能路由公测

    Cloudflare 宣布在 AI Gateway 中推出 Auto Router(cloudflare/auto)公测版,可根据任务特征自动将请求路由到能力匹配且成本最优的模型。该系统利用边缘分类器评估请求类别与复杂度,并综合模型单价与上下文缓存切换惩罚进行动态评分。内部基准测试显示其成本相比顶尖前沿模型最高可降低 30%,公测期间免费向开发者开放。

    推荐理由:该方案将多维度分类与缓存成本惩罚机制引入请求级路由,有助于企业在不牺牲复杂任务效果的前提下降低日常推理开销。

  4. Hacker News · AI72

    本地大模型可观测性工具 LLMxRay 开源

    LLMxRay 是一款面向本地大模型的开源可视化可观测性工具,支持实时 Token 流式监测、响应质量检查、性能分析与云端等价成本估算。工具完全在本地运行无需云端 API Key,深度适配 Ollama 后端,内置用于分析提示词 KV 缓存命中损耗的 Cache Lab、多模型横向对比、协议差异分析以及本地 RAG 检索可视化功能。用户可通过 npx 或 Docker 命令在本地快速启动。

    推荐理由:针对本地大模型运行的黑盒问题,该工具提供了流式生成延迟与提示词缓存命中的可视化诊断手段,便于开发者优化推理性能。

  5. vLLM 官方博客(网页)77

    vLLM 分离式推理实践指南:Prefill/Decode 分离与纯 CPU 前端架构

    vLLM 官方发布分离式推理(Disaggregated Serving)实战指南,详细拆解如何将 Prefill 与 Decode 阶段解耦并将分词与解析剥离至纯 CPU 前端。

    推荐理由:原文系统阐述了 vLLM 分离式推理架构的实现细节与部署代码,读者可以据此评估长上下文高并发场景下的性能收益与运维权衡。

  6. AITNT · AI头条(网页)78

    DeepSeek 开源面向华为昇腾的基础设施组件与编译工具

    DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具以及 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect 等计算与通信库。

    推荐理由:DeepSeek 将此前在英伟达平台验证的算子与通信工具适配至昇腾平台,为国产算力开发者提供了源于大模型实战的底层优化实现。

  7. IT168 服务器存储 · AI与算力(网页)79

    华为发布昇腾960超节点与NPO光互联产品,公布百万卡算力集群演进路线

    华为在全联接大会2026上发布业界首款采用NPO光互联技术的昇腾960超节点、7.2T传输容量的Hi-ONE光互联引擎以及OceanStor M900 KV缓存集群。

    推荐理由:原文披露了昇腾960超节点与NPO光互联架构细节,展示了面向百万卡AI集群从总线协议到多层缓存的系统级工程方案。

  8. IDC 圈·云与算力(网页)68

    《中国词元工厂发展白皮书(2026)》解读:词元工厂盈利边界与运营护城河

    科智咨询联合算力海洋发布的白皮书测算显示,受硬件高溢价、夜间利用率不足及价格竞争挤压,当前词元工厂整体处于保本打平或微亏状态。敏感性分析表明商业利用率是对内部收益率影响最大的变量,需稳定在 65% 以上才有投资价值。同时工程调优等软件手段可将有效吞吐提升 1.5 至 2 倍并降低 30% 以上单位成本,行业竞争正从硬件规模转向利用率与精细化运营能力。

    推荐理由:报告通过全生命周期测算拆解了推理算力工厂的成本结构,为智算中心的商业化运营与工程优化提供了具体参考指标。

  9. IT之家 · AI 筛选79

    DeepSeek 开源面向华为昇腾算力平台的基础设施组件

    DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库及分布式通信库,与英伟达平台开源组件一一对应。

    推荐理由:原文给出了底层编译与通信组件从英伟达向华为昇腾的对应适配细节,有助于评估国产算力在训练和算子开发上的可用性。

  10. Cerebras 官方博客(网页)82

    Cerebras CS-3 接入 AWS 数据中心,联合推出 Trainium 分离式推理架构

    Cerebras 宣布 AWS 正在其数据中心部署 Cerebras CS-3 系统,后续将通过 AWS Bedrock 提供开源大语言模型与 Amazon Nova 系列的高速推理服务。

    推荐理由:双方通过将Prefill与Decode解耦至不同硬件,为大吞吐量智能体编码等高速推理场景提供了新的软硬件协同方案。

  11. Cerebras 官方博客(网页)72

    Cerebras 解读解耦推理:拆分 Prefill 与 Decode 重塑大模型推理架构

    Cerebras 阐述了大模型解耦推理架构,将算力密集的 Prefill 阶段与内存带宽受限的 Decode 阶段拆分至不同硬件独立运行。

    推荐理由:文章系统阐述了将大模型推理的 Prefill 与 Decode 阶段解耦运行的技术原理,展示了异构硬件协同提升吞吐与降低尾部延迟的路径。

  12. Cerebras 官方博客(网页)62

    Cerebras 与 Cognition 合作案例:为 Windsurf 搭载的 SWE-1.6 智能体提供高速推理支持

    Cognition 选用 Cerebras 推理平台为其软件工程模型 SWE-1.6 以及 SWE-grep 子智能体提供算力支持,在 Windsurf 的 Fast 档位中实现了最高 950 tokens/s 的生成速度。

    推荐理由:文章展示了模型层与硬件推理层协同优化的落地数据,读者可借此了解高速推理对编程智能体交互体验的具体提升。

  13. Cerebras 官方博客(网页)65

    Cerebras 推出 Kimi K2.6 万亿参数企业级推理服务

    Cerebras 宣布面向企业客户测试开放万亿参数开源模型 Kimi K2.6 的高速推理服务。经 Artificial Analysis 独立实测,Cerebras 运行 K2.6 的生成速度达每秒 981 个 output tokens,针对 10k 输入加 500 输出的复杂请求总耗时仅 5.6 秒,比官方接口快 29 倍。

    推荐理由:原文给出了万亿参数模型在晶圆级硬件上的实测吞吐与端到端延迟对比,读者可据此评估高速推理对智能体编码工作流的提速幅度。

  14. Cerebras 官方博客(网页)69

    Cerebras 推理平台上线 Gemma 4 31B 多模态模型

    Cerebras 宣布在其推理平台上推出 Google DeepMind 开源模型 Gemma 4 31B,以超过 1,800 tokens per second(第三方测得 1,851 TPS)的吞吐运行,成为该晶圆级计算平台首个支持图像理解的多模态模型。

    推荐理由:原文给出了 1,851 tokens per second 的多模态推理吞吐与首 token 延迟数据,读者可据此评估极速视觉智能体工作流的落地可行性。