vLLM 强化学习框架 vime 适配 ROCm,支持在 AMD Instinct GPU 上端到端后训练
vLLM 团队宣布强化学习框架 vime 正式支持 AMD ROCm 生态,可在 AMD Instinct MI355X 等 GPU 上开箱即用运行端到端强化学习后训练。
推荐理由:官方提供了预构建容器与端到端实测数据,开发者可直接在 AMD 硬件上复用 vLLM 的强化学习后训练工作流。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
vLLM 团队宣布强化学习框架 vime 正式支持 AMD ROCm 生态,可在 AMD Instinct MI355X 等 GPU 上开箱即用运行端到端强化学习后训练。
推荐理由:官方提供了预构建容器与端到端实测数据,开发者可直接在 AMD 硬件上复用 vLLM 的强化学习后训练工作流。
vLLM 宣布通过 V1 版本的公共连接器接口集成 TileRT 0.1.5 解码引擎,实现零侵入代码修改的 Prefill-Decode 分离式推理。该方案支持原生 vLLM 负责 Prefill、TileRT 负责低延迟 Decode,二者可通过 RDMA 传输 KV 缓存并在同一服务层共存。
推荐理由:原文给出了零侵入复用现有推理生态的具体架构与配置,有助于读者评估低延迟场景下的分离式推理改造方案。
vLLM 宣布首发支持 Thinking Machines Lab 推出的 1T 参数原生多模态模型 TML Inkling,覆盖 NVFP4 与 BF16 两个版本,原生支持文本、图像与音频输入及最高 1M 上下文。
推荐理由:框架通过短卷积分片与通信融合等算子优化完成了万亿多模态模型适配,为超大模型长上下文推理提供了工程参考。
vLLM Semantic Router 宣布从单一请求路由演进为构建、评测和运行 Mixture-of-Models(MoM)的系统引擎,对外提供统一的模型交互接口。
推荐理由:文章阐明了将分散的独立大模型封装为统一 MoM 系统的架构设计,读者可以了解跨硬件和多模型协同调度的工程实现路径。
vLLM 宣布将为月之暗面(Moonshot AI)预计 7 月 27 日开源的 2.8T 参数模型 Kimi K3 提供 Day-0 生产级推理支持。针对 KDA 循环注意力机制,vLLM 将物理状态块大小与前缀匹配粒度解耦,实现了细粒度前缀缓存命中与写时复制。
推荐理由:文章详细拆解了针对 KDA 循环注意力与 MXFP4 MoE 的前缀缓存重构及算子优化,读者可据此了解超大混合架构在开源引擎中的工程落地细节。
vLLM 发布实验性插件 vLLM AFD Plugin,通过将 MoE 模型的 Attention 与 FFN 拆分为独立部署的服务,实现两者的独立扩缩容。插件支持 NVIDIA GPU 与华为昇腾 NPU 后端,兼容 DeepSeek V2/V3 及 GLM MoE 等架构,无需修改 vLLM 源码即可通过标准插件接口接入。
推荐理由:原文解析了通过解耦 Attention 与 FFN 服务实现 MoE 独立扩缩容的架构设计与实测数据,为大模型推理部署优化提供了参考。
vLLM 宣布首日支持月之暗面 2.8T 参数模型 Kimi K3,提供混合 KDA 前缀缓存与 DSpark 投机解码等生产级部署方案。在 16 卡 NVIDIA GB300 NVL72 上配合 DSpark 投机解码单用户吞吐可达 370 tok/s,解码速度提升 3.14 倍。
推荐理由:文章详细拆解了针对超大混合架构模型的缓存改造与投机解码方案,为同类长上下文 MoE 的高效部署提供了完整参考。
Speculators 与 vLLM 宣布全面开源支持 P-EAGLE、DFlash 和 DSpark 三种并行推测解码算法,摆脱了 EAGLE-3 等传统框架自回归逐词生成候选 token 的延迟瓶颈。
推荐理由:原文解析了三种并行推测解码架构与训练优化机制,为大模型在线服务降低草稿延迟与参数调优负担提供了工程参考。
Cloudflare 正式发布基于 Astro 架构的开源内容管理系统 EmDash 1.0,并推出基于 AT Protocol 的去中心化插件注册表。系统内置 MCP 服务器支持 AI 智能体直接调用管理,插件通过 Dynamic Worker 或 workerd 独立沙盒运行并限制权限,同时开源了 AI 建站工具 EmDash Build Alpha 版本。
推荐理由:EmDash 结合了 Astro 框架与沙盒化插件隔离机制,为开发者和 AI 智能体协作构建与管理网站提供了可参考的架构实践。
Cloudflare 宣布为其运行在 Workers 上的智能体专用浏览器 Kitesurf 推出重大更新,新增了对 WebMCP 协议的全面支持,使 AI 智能体可直接调用网页暴露的工具函数。
推荐理由:原文展示了边缘无头浏览器专为智能体优化延迟与协议接入的演进路径,有助于开发者评估轻量化网页自动化方案。
Cloudflare 宣布开源代码生成流水线 Forge,采用 Apache 2.0 协议,支持根据 OpenAPI 规范自动生成 SDK、CLI、API 文档及 MCP 服务。
推荐理由:文章详细说明了在大规模微服务和智能体交互场景下,如何通过可插拔流水线链式生成跨语言 SDK、CLI、文档与 MCP 服务。
Cloudflare 正式发布开源框架 Vinext 1.0,支持将基于 App Router 或 Pages Router 的 Next.js 项目迁移至 Vite 底座并部署到 Cloudflare Workers、Netlify 及 AWS Lambda 等平台。
推荐理由:该框架打破了 Next.js 与特定托管平台的强绑定,为开发者评估将大型全栈应用迁移至边缘运行时提供了具体的兼容性路径与工具链。
Cloudflare 宣布推出面向 AI 智能体开发的全新命令行工具 cf,覆盖全平台超过 3,000 项 API 操作,并开启全球公开测试。cf 默认采用紧凑 JSON 输出以节省上下文,提供支持自然语言检索指令的 `cf cli search`,并引入基于 TypeScript 的全新配置文件 `cloudflare.config.ts` 与 Vite 开发环境。
推荐理由:工具将整个平台三千多项 API 封装为类型化且适合智能体检索调用的命令行,为自动化基础设施管理提供了直接参考。
Modal 与卡内基梅隆大学联合推出专为 AI-SQL 负载设计的推理层 Quail(QUery-Aware Inference Layer),通过联合优化查询规划器与推理引擎提升分析型数据库中的大模型吞吐。
推荐理由:原文针对分析型数据库中的大模型推理负载,通过联合查询规划与缓存管理协同优化,为高吞吐纯 Prefill 场景提供了可借鉴的架构方案。
开发者发布开源项目 data-agent-rules,通过 8 条操作规则、5 项专属技能以及 safe_peek 脱敏预览和 cost_check 成本预估工具,防止 Claude Code、Cursor、Copilot 等 AI 智能体在数仓中误删、篡改数据或触发高额扫描账单。
推荐理由:项目通过规则约束与 MCP 工具规范 AI 编写 SQL,并在本地评测中给出了规避数据误删和高额查询账单的落地解法。
Google 宣布开源 C++ 库 Credentio,用于处理 C2PA 内容凭据(支持 2.2 和 2.4 版本规范),支持完全在本地验证多媒体资产来源。该库已被 Google 内部近 40 款产品用于处理数百亿级图像、视频、音频和文档资产,具备低内存占用与零云端带宽开销特点。
推荐理由:原文展示了 Google 内部用于数十亿资产校验的 C2PA 本地处理方案,为需要离线验证多媒体来源与合规性的开发者提供了低延迟参考。
Google 正式推出 Agent Development Kit(ADK)for Kotlin 1.0 正式版,面向 Kotlin、Java 及 Android 开发者提供原生 AI 智能体开发支持。
推荐理由:该框架将多智能体编排与 Android 原生持久化和端侧推理结合,为 Kotlin 及移动端开发者提供了开箱即用的工程方案。
AWS 正式在 Amazon Bedrock 和 Claude Platform on AWS 上提供 Claude Sonnet 5.5。该模型针对聚焦型编程和知识工作优化,具备更快的执行速度与更低的任务单价,支持与 IAM、CloudTrail、CloudWatch 及 Bedrock Guardrails 等 AWS 原生治理工具集成。
推荐理由:文章明确了该模型在企业工程中的分工定位与调用方式,便于开发者评估架构组合与成本配比。
Meta 宣布将 AI 智能体 Muse 扩展至小型企业,新增对 Shopify、Dropbox、Slack、Stripe、Zoom 等第三方软件以及 Meta 广告和主页的集成。
推荐理由:Meta 将智能体接入小企业现有的日常运营工具,展现了从独立聊天机器人转向全业务上下文智能体的落地路径。
美国白宫宣布上线 AI 聊天机器人 America.gov,旨在为公众提供一站式查询政府服务与规定的入口。Google 确认作为合作伙伴参与并接入了 Gemini 模型,美国首席设计官 Joe Gebbia 透露该平台同时使用了 Grok。外界指出大语言模型仍存在幻觉风险,若在食品券申请、签证续签或报税等关键政务流程中给出错误信息可能带来严重后果。
推荐理由:报道指出了白宫政务问答工具引入商业模型的具体合作方,并从模型幻觉角度揭示了民生服务场景中的潜在误导风险。