跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

133条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 21–40 条 · 共 133 条
9月30日周三
  1. LlamaIndex 官方博客(网页)66

    LlamaIndex 发布 LiteParse 2026 年 9 月更新:优化解析性能并新增视觉定位与复杂度路由

    LlamaIndex 宣布开源 PDF 解析工具 LiteParse 迎来重要更新,通过在其 PDFium 分支中引入 mimalloc 内存优化与热路径缓存,将文本提取耗时降低 20–25%,在无 OCR 情况下达到平均 2.8ms/页的提取速度和 3.9ms/页的 Markdown 渲染速度。

    推荐理由:文章详细拆解了通过改造底层 PDFium 内存分配提升无模型解析吞吐的工程细节,为文档预处理与路由分流提供了实测基准。

  2. vLLM 官方博客(网页)67

    vLLM 推出会话感知智能体路由 SAAR,优化长流程 Agent 模型调度与缓存成本

    vLLM 在 Semantic Router 中正式引入会话感知智能体路由 SAAR,通过会话级状态控制解决长流程 Agent 在单轮 prompt 路由下易打断工具调用与丢失前缀缓存的问题。

    推荐理由:原文针对长流程智能体多轮调度痛点,提出结合工具循环锁与前缀缓存定价的会话级路由策略,为大模型推理网关降本与连续性保障提供了工程参考。

  3. vLLM 官方博客(网页)64

    vLLM 联合 DeepLearning.AI 推出大语言模型高效推理实战课程

    vLLM 联合 Red Hat 与吴恩达创办的 DeepLearning.AI 推出免费实战课程《Fast & Efficient LLM Inference with vLLM》,讲解大语言模型推理优化、部署及基准评测全流程。

    推荐理由:课程系统串联了模型量化、vLLM 服务部署与压测评估的全流程,适合需要掌握大语言模型推理优化与工程落地的开发者参考。

  4. vLLM 官方博客(网页)72

    vLLM Semantic Router v0.3 Themis 发布:引入会话感知路由与规范配置契约

    vLLM 官方发布 Semantic Router v0.3 Themis,将语义路由升级为状态化、可观测的生产级控制平面。该版本统一了本地、控制台与 Kubernetes 的 v0.3 规范配置契约,推出支持工具循环硬锁定与路由器会话记忆的会话感知智能体路由(SAAR),并新增将原始信号规范化为决策策略的 Projection 机制。

    推荐理由:材料系统梳理了语义路由器从信号到决策的流水线设计与状态化路由机制,为多模型调度与生产级推理网关架构提供了完整参考。

  5. vLLM 官方博客(网页)74

    vLLM 原生支持扩散大语言模型 DiffusionGemma

    vLLM 宣布原生支持基于 Gemma4 构建的 26B 离散扩散大语言模型 DiffusionGemma,成为该框架首个原生接入的 dLLM。实现上通过 Model Runner V2 的 ModelState 抽象管理逐请求状态,复用投机解码路径与动态序列级因果注意力,支持单批次内自回归与双向去噪混合处理。

    推荐理由:原文详述了利用 ModelState 抽象与投机解码路径接入扩散大模型的技术方案,为非自回归推理服务提供了工程实践参考。

  6. vLLM 官方博客(网页)70

    vLLM-Omni 语音合成推理工程优化实践

    vLLM 团队发布了 vLLM-Omni 针对语音合成(TTS)模型的全套推理优化方案,支持 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro。

    推荐理由:文章详细拆解了四种不同架构 TTS 模型的推理瓶颈与定制优化方案,为多模态语音服务部署提供了系统的工程参考。

  7. vLLM 官方博客(网页)69

    vLLM 推出语义路由器微智能体运行时并开放 vllm-sr/auto

    vLLM 官方发布基于语义路由器的微智能体运行时,通过统一的 `vllm-sr/auto` API 接口在服务层内调度多模型协作。系统支持 Confidence、Ratings、ReMoM、Fusion 和 Workflows 五种协同回路模式,由路由层统一管理预算、并发上限、容错与输出协议。

    推荐理由:文章把多模型协同机制下沉为开源推理服务基础设施,读者可以借此了解如何在单接口下编排多模型推理策略。

  8. vLLM 官方博客(网页)66

    vLLM-Omni 部署与优化多阶段 Qwen3-Omni 的实践经验

    vLLM-Omni 针对 Qwen3-Omni 提出了涵盖阶段拆分、CUDA Graph、异步分块传输、异步输出与按需副本扩展的全栈在线推理优化方案。该方案将 Thinker(多模态推理)、Talker(Codec 预测)与 Code2Wav(波形重建)流水线解耦,消除了跨阶段全载荷等待与 Python 调度开销。

    推荐理由:文章拆解了语音多模态模型分阶段推理的延迟瓶颈,所提出的异步流水线与阶段级扩展方案可直接迁移至同类实时全模态架构。

  9. vLLM 官方博客(网页)63

    vLLM 集成腾讯混元 HPC-Ops Attention 与 MoE 高性能后端

    腾讯混元 AI Infra 团队打造的高性能算子库 HPC-Ops 正式合入 vLLM 主干分支,作为第一类原生 Attention 与 MoE 后端提供支持。

    推荐理由:原文给出了动态负载均衡解码调度与全融合 FP8 MoE 算子的实测数据,读者可以参考其在长短序列混杂推理与 H20 硬件上的延迟优化收益。

  10. vLLM 官方博客(网页)64

    vLLM 强化学习框架 vime 适配 ROCm,支持在 AMD Instinct GPU 上端到端后训练

    vLLM 团队宣布强化学习框架 vime 正式支持 AMD ROCm 生态,可在 AMD Instinct MI355X 等 GPU 上开箱即用运行端到端强化学习后训练。

    推荐理由:官方提供了预构建容器与端到端实测数据,开发者可直接在 AMD 硬件上复用 vLLM 的强化学习后训练工作流。

  11. vLLM 官方博客(网页)68

    vLLM 集成 TileRT 解码引擎实现低延迟 PD 分离推理

    vLLM 宣布通过 V1 版本的公共连接器接口集成 TileRT 0.1.5 解码引擎,实现零侵入代码修改的 Prefill-Decode 分离式推理。该方案支持原生 vLLM 负责 Prefill、TileRT 负责低延迟 Decode,二者可通过 RDMA 传输 KV 缓存并在同一服务层共存。

    推荐理由:原文给出了零侵入复用现有推理生态的具体架构与配置,有助于读者评估低延迟场景下的分离式推理改造方案。

  12. vLLM 官方博客(网页)76

    vLLM 揭秘生产级质量保障体系:CI、基准评测与双周发布流程

    vLLM 官方团队发文拆解了其保障生产级质量的三层工程体系,涵盖 CI 自动化、端到端夜间基准评测以及双周发版流程。第一层 CI 依托 Buildkite 管理 58 个异构加速卡队列,通过统一容器镜像与依赖锁定消除环境漂移,并借助 AI 智能体实现故障自动诊断与回滚。

    推荐理由:vLLM 团队拆解了异构算力下的 CI 调度、夜间性能精度评测及双周发版机制,为开源 AI 项目的工程化交付提供了可复用的实践参考。

  13. vLLM 官方博客(网页)73

    vLLM 预览 Kimi K3 生产级推理支持:重构 KDA 前缀缓存并优化 MXFP4 MoE

    vLLM 宣布将为月之暗面(Moonshot AI)预计 7 月 27 日开源的 2.8T 参数模型 Kimi K3 提供 Day-0 生产级推理支持。针对 KDA 循环注意力机制,vLLM 将物理状态块大小与前缀匹配粒度解耦,实现了细粒度前缀缓存命中与写时复制。

    推荐理由:文章详细拆解了针对 KDA 循环注意力与 MXFP4 MoE 的前缀缓存重构及算子优化,读者可据此了解超大混合架构在开源引擎中的工程落地细节。

  14. vLLM 官方博客(网页)70

    vLLM 推出 AFD 插件:解耦 Attention 与 FFN 实现 MoE 灵活推理

    vLLM 发布实验性插件 vLLM AFD Plugin,通过将 MoE 模型的 Attention 与 FFN 拆分为独立部署的服务,实现两者的独立扩缩容。插件支持 NVIDIA GPU 与华为昇腾 NPU 后端,兼容 DeepSeek V2/V3 及 GLM MoE 等架构,无需修改 vLLM 源码即可通过标准插件接口接入。

    推荐理由:原文解析了通过解耦 Attention 与 FFN 服务实现 MoE 独立扩缩容的架构设计与实测数据,为大模型推理部署优化提供了参考。

  15. vLLM 官方博客(网页)73

    vLLM 在 24 张 NVIDIA B300 上部署优化 GLM-5.2:TPOT 从 40ms 降至 17ms

    DaoCloud 团队在 vLLM 官方博客分享了在 24 块 NVIDIA B300 GPU 上部署 GLM-5.2-NVFP4 的生产级优化实践,采用 4P1D 的 P/D 分离拓扑将平均 TPOT 从 40ms 降至 17ms,达成 TTFT ≤ 2.5s 与 TPOT ≤ 20ms 的 SLA 目标。

    推荐理由:文章详细拆解了超大 MoE 模型在长上下文与投机解码下的端到端调优路径,给出了完整的部署配置与长周期排障经验。

  16. vLLM 官方博客(网页)81

    vLLM 宣布首日支持月之暗面 Kimi K3

    vLLM 宣布首日支持月之暗面 2.8T 参数模型 Kimi K3,提供混合 KDA 前缀缓存与 DSpark 投机解码等生产级部署方案。在 16 卡 NVIDIA GB300 NVL72 上配合 DSpark 投机解码单用户吞吐可达 370 tok/s,解码速度提升 3.14 倍。

    推荐理由:文章详细拆解了针对超大混合架构模型的缓存改造与投机解码方案,为同类长上下文 MoE 的高效部署提供了完整参考。

  17. Cloudflare Blog · 网络基础设施69

    Cloudflare 发布开源内容管理系统 EmDash 1.0 并上线去中心化插件注册表

    Cloudflare 正式发布基于 Astro 架构的开源内容管理系统 EmDash 1.0,并推出基于 AT Protocol 的去中心化插件注册表。系统内置 MCP 服务器支持 AI 智能体直接调用管理,插件通过 Dynamic Worker 或 workerd 独立沙盒运行并限制权限,同时开源了 AI 建站工具 EmDash Build Alpha 版本。

    推荐理由:EmDash 结合了 Astro 框架与沙盒化插件隔离机制,为开发者和 AI 智能体协作构建与管理网站提供了可参考的架构实践。

  18. Cloudflare Blog · 网络基础设施63

    Cloudflare 发布 Vinext 1.0,基于 Vite 实现 Next.js 应用跨平台部署

    Cloudflare 正式发布开源框架 Vinext 1.0,支持将基于 App Router 或 Pages Router 的 Next.js 项目迁移至 Vite 底座并部署到 Cloudflare Workers、Netlify 及 AWS Lambda 等平台。

    推荐理由:该框架打破了 Next.js 与特定托管平台的强绑定,为开发者评估将大型全栈应用迁移至边缘运行时提供了具体的兼容性路径与工具链。