跳到正文
今天9月30日周三
  1. vLLM 官方博客(网页)77

    vLLM 分离式推理实践指南:Prefill/Decode 分离与纯 CPU 前端架构

    vLLM 官方发布分离式推理(Disaggregated Serving)实战指南,详细拆解如何将 Prefill 与 Decode 阶段解耦并将分词与解析剥离至纯 CPU 前端。

    推荐理由:原文系统阐述了 vLLM 分离式推理架构的实现细节与部署代码,读者可以据此评估长上下文高并发场景下的性能收益与运维权衡。

  2. AITNT · AI头条(网页)65

    AI Has Taste 多智能体系统推翻数学论文猜想,自动化产出 453 篇研究手稿

    思特雅大学研究人员搭建的数学多智能体系统 AI Has Taste 实现了从答案生成到研究议程生成的闭环,其构造的反例已获原论文作者回信确认推翻原猜想。该系统将选题、证明、独立挑错审查与写作拆分为多角色协作,能把失败路线转化为可证伪的新命题与统一界猜想。目前项目在 GitHub 记录了 453 份数学手稿共 2312 页,并引入马来西亚科学院院士等学者参与部分结果的验证与复核。

  3. arXiv 人工智能44

    基于接收端条件化的潜空间通信实现 94% CacheBack

    研究提出无需训练的多智能体潜空间通信方法 CacheBack,通过接收端提供的信息需求描述来过滤并压缩发送端的 KV cache。在 FanOutQA 基准上,基于 Qwen 3 的 CacheBack 削减了 75% 的传输状态,相比文本通信将准确率提升 14.7 个百分点,任务完成延迟中位数降低 3.2x。该方案在稠密 Transformer、Mamba 混合架构等多种模型族上均实现类似优化。

  4. arXiv 人工智能44

    Choir:用于分布式多智能体自动形式化的开放协议

    研究人员推出开源协议 Choir,用于实现分布式多智能体定理自动形式化。Choir 将形式化项目分解为独立任务,支持各贡献者运行自带 LLM 订阅的 AI 智能体并通过 GitHub 协作,所有提交均由确定性门控检查后合并。该协议采用模块化设计且支持扩展,目前已兼容 Lean 4、Isabelle 和 Rocq。

  5. AITNT · AI头条(网页)87

    OpenAI 推出 7x24 小时常驻智能体 dots 与 GPT-6.1 Sol,上线 ChatGPT Space 及 Pro 500 订阅

    OpenAI 在 DevDay 上发布全天候常驻 Agent dots,配备独立云端电脑和浏览器并支持接入超 4000 种工具,可在后台全天候自动化执行建站与代码重构等任务。

    推荐理由:原文汇总了常驻智能体与协作空间的架构变化及定价,读者可以据此评估全天候自动化工作流对团队协作模式的影响。

  6. 爱范儿 · AI 筛选84

    OpenAI 开发者大会发布智能体 Dot、ChatGPT Space 与高性价比模型 GPT-6.1 Sol 等全系新品

    OpenAI 在开发者大会上公布了全天候自主智能体 Dot、人机协作空间 ChatGPT Space 以及主力模型 GPT-6.1 Sol 等一系列新品。

    推荐理由:原文系统梳理了 OpenAI 构建智能体协作平台的多款新品细节与定价对比,有助于读者评估其对现有开发及企业工作流的综合影响。

  7. Cerebras 官方博客(网页)38

    StackAI 接入 Cerebras 为企业级 AI 智能体提供极速推理

    企业级低代码智能体平台 StackAI 正式接入 Cerebras 推理服务,为其合规审查、理赔与信贷决策等多步工作流提供亚秒级响应,推理速度最高比 GPU 快 15 倍。在金融、医疗及政务等高合规场景中,该集成使多步工作流延迟降低最高达 50%,高峰期吞吐稳定性提升最高 10 倍,工作流级推理成本降低 20–35%。

  8. Cerebras 官方博客(网页)72

    Cerebras 发布 Codex Spark 编码实践指南

    Cerebras 介绍了在 WSE 硬件上以超过 1,200 tokens/s 运行的 GPT-5.3-Codex-Spark 最佳编程实践。指南建议将 Spark 作为高频交互的结对编程者而非异步委托代理,通过高频测试验证、多方案快速探索以及保持单会话专注来避免代码质量退化。同时推荐将 Git 和 Markdown 文件作为持久化外部记忆,配合权限沙箱与文档自动化维护机制以降低长上下文漂移。

    推荐理由:文章系统梳理了高吞吐推理下的实时结对编程方法,为开发者提供了从单任务循环到上下文管理的完整实践模式。

  9. Cerebras 官方博客(网页)82

    Cerebras CS-3 接入 AWS 数据中心,联合推出 Trainium 分离式推理架构

    Cerebras 宣布 AWS 正在其数据中心部署 Cerebras CS-3 系统,后续将通过 AWS Bedrock 提供开源大语言模型与 Amazon Nova 系列的高速推理服务。

    推荐理由:双方通过将Prefill与Decode解耦至不同硬件,为大吞吐量智能体编码等高速推理场景提供了新的软硬件协同方案。

  10. Cerebras 官方博客(网页)77

    Cerebras 实测 Karpathy 的 autoresearch:如何防止 AI 自主研究闭环失控与偏离目标

    Cerebras 针对 Karpathy 提出的 autoresearch 框架开展了 71 次实测,开源了 codex-autoresearch-harness 和 reap-expert-swap 工具,并总结了防止智能体自主实验偏离目标的工程实践。

    推荐理由:原文通过两组真实任务实测了自主研究智能体的边界,给出了约束环境漂移和控制算力开销的具体方案。

  11. Cerebras 官方博客(网页)76

    Cerebras 分享多智能体工作流构建经验与 5 种实用设计模式

    Cerebras 官方博客总结了构建多智能体工作流的实战经验,提出将单智能体拆解为“主厨(调度器)与配菜工(子智能体)”协作架构,以解决单智能体容易触碰的上下文膨胀和失败率过高问题。

    推荐理由:原文通过厨房主厨与配菜工的比喻系统梳理了 5 种多智能体设计模式,读者可以据此将复杂 AI 编码任务拆解为轻量上下文并行与验证工作流。

  12. Cerebras 官方博客(网页)52

    Cerebras 扩展超低延迟推理生态并接入主流开发工具链

    Cerebras 宣布全面扩展其超低延迟推理生态,基于晶圆级芯片架构提供最高达传统 GPU 系统 15 倍的推理速度。平台支持主流开源代码与推理模型,提供自服务 API 与云市场采购渠道,并深度集成了 LangChain、CrewAI、Cline、Windsurf 及 LiteLLM 等涵盖智能体、编程与可观测性的开发工具链。

  13. Cerebras 官方博客(网页)65

    Cerebras 推出 Kimi K2.6 万亿参数企业级推理服务

    Cerebras 宣布面向企业客户测试开放万亿参数开源模型 Kimi K2.6 的高速推理服务。经 Artificial Analysis 独立实测,Cerebras 运行 K2.6 的生成速度达每秒 981 个 output tokens,针对 10k 输入加 500 输出的复杂请求总耗时仅 5.6 秒,比官方接口快 29 倍。

    推荐理由:原文给出了万亿参数模型在晶圆级硬件上的实测吞吐与端到端延迟对比,读者可据此评估高速推理对智能体编码工作流的提速幅度。

  14. Cerebras 官方博客(网页)69

    Cerebras 推理平台上线 Gemma 4 31B 多模态模型

    Cerebras 宣布在其推理平台上推出 Google DeepMind 开源模型 Gemma 4 31B,以超过 1,800 tokens per second(第三方测得 1,851 TPS)的吞吐运行,成为该晶圆级计算平台首个支持图像理解的多模态模型。

    推荐理由:原文给出了 1,851 tokens per second 的多模态推理吞吐与首 token 延迟数据,读者可据此评估极速视觉智能体工作流的落地可行性。

  15. vLLM 官方博客(网页)62

    vLLM 发布 Speculators v0.5.0:支持 DFlash 算法与统一在线离线训练

    vLLM 发布投机采样训练框架 Speculators v0.5.0,引入 DFlash 块扩散算法并统一了在线与离线训练流程。DFlash 采用非因果注意力与锚点位置机制,在单次前向传播中生成整块草稿 token,在 Gemma 4 31B 评测中取得了低于 Eagle 3 的 token 间延迟。

    推荐理由:材料详细介绍了单次前向传播生成草稿词的机制与训练解耦方案,为大模型推理加速与投机采样落地提供了参考路径。

  16. vLLM 官方博客(网页)60

    NVIDIA DGX Spark 运行 vLLM 的架构配置与本地评测指南

    vLLM 官方博客解析了在基于 GB10 芯片的 NVIDIA DGX Spark 上进行本地大模型推理的架构适配与配置方案。针对 128 GB 统一内存特性,系统需要通过限制并发与预留内存来平衡系统运行,并借助 Paged KV cache 与连续批处理保证交互响应。

    推荐理由:文章给出了统一内存架构下本地大模型推理的关键参数与实测数据,为桌面端算力硬件部署提供了可复现的调优参考。

  17. vLLM 官方博客(网页)82

    vLLM 宣布首发支持 NVIDIA Nemotron 3 Ultra 推理

    vLLM 正式宣布为开源模型 NVIDIA Nemotron 3 Ultra 提供首发推理支持,支持通过 OpenAI 兼容 API 提供服务。Nemotron 3 Ultra 拥有 550B 总参数量与 55B 激活参数,采用 Transformer-Mamba 混合 MoE 架构,支持最高 1M tokens 上下文及 NVFP4 与 BF16 精度。

    推荐理由:原文提供了模型规格与完整的服务启动配置,开发者可以据此在多卡集群上快速部署该长程推理模型。

  18. LlamaIndex 官方博客(网页)43

    用于收据的智能体 OCR:为什么传统流水线会失效

    传统 OCR 流水线因仅优化字符转录而缺乏结构理解,面对版面多变的收据极易导致下游自动化失效。LlamaCloud 采用基于 VLM 的统一智能体 OCR 架构,将视觉识别、版面理解、结构化推理与数值校验循环整合至单一引擎。该方案消除了繁琐的正则规则维护,可直接输出保留字段层级与行项目关系的结构化 JSON、Markdown 或 HTML 数据。

  19. vLLM 官方博客(网页)74

    vLLM 原生支持扩散大语言模型 DiffusionGemma

    vLLM 宣布原生支持基于 Gemma4 构建的 26B 离散扩散大语言模型 DiffusionGemma,成为该框架首个原生接入的 dLLM。实现上通过 Model Runner V2 的 ModelState 抽象管理逐请求状态,复用投机解码路径与动态序列级因果注意力,支持单批次内自回归与双向去噪混合处理。

    推荐理由:原文详述了利用 ModelState 抽象与投机解码路径接入扩散大模型的技术方案,为非自回归推理服务提供了工程实践参考。

  20. vLLM 官方博客(网页)76

    vLLM 首发支持 MiniMax M3:实现 1M 上下文多模态稀疏注意力推理

    vLLM 宣布首发支持 MiniMax M3 的 BF16 与 MXFP8 检查点,提供 1M token 上下文的原生多模态推理服务。该方案针对 MiniMax 稀疏注意力(MSA)设计了 128-token 粒度的分块预填充与解码算子,集成 EAGLE3 投机解码及工具与思考解析器。

    推荐理由:文章给出了稀疏注意力算子实现、投机解码调优及软硬件启动参数,为百万长上下文多模态模型的低延迟上线提供了具体参考。

  21. vLLM 官方博客(网页)70

    vLLM Semantic Router 推出 Fusion 多模型融合路由功能

    vLLM 在其语义路由器(vLLM-SR)中推出 Fusion 原语,支持并发调用多模型面板生成候选答案,并通过裁判模型分析共识与分歧后合成最终回复。该机制提供 vllm-sr/auto 自动路由、vllm-sr/fusion 显式调用及请求级插件覆盖三种入口,支持全链路跟踪记录与按策略容错。

    推荐理由:原文给出了多模型面板协同与裁判合成的具体路由机制,为生产环境按需平衡延迟与模型组合质量提供了可落地参考。

  22. LlamaIndex 官方博客(网页)36

    Agentic AI 如何提升文档提取准确率与自动化水平

    Agentic AI 将文档处理转为推理任务,利用“计划-执行-验证”闭环在提取前理解文档结构与意图,并在提取后进行自我纠错。系统结合视觉定位与边界框感知二维空间布局,能动态推理复杂表格及多源发票等可变版式,解决传统 OCR 缺失语境和易受格式变动破坏的缺陷。例如 LlamaParse 在最终确认提取前,会确保视觉布局与语义内容相互印证。

  23. vLLM 官方博客(网页)69

    vLLM 推出语义路由器微智能体运行时并开放 vllm-sr/auto

    vLLM 官方发布基于语义路由器的微智能体运行时,通过统一的 `vllm-sr/auto` API 接口在服务层内调度多模型协作。系统支持 Confidence、Ratings、ReMoM、Fusion 和 Workflows 五种协同回路模式,由路由层统一管理预算、并发上限、容错与输出协议。

    推荐理由:文章把多模型协同机制下沉为开源推理服务基础设施,读者可以借此了解如何在单接口下编排多模型推理策略。

  24. vLLM 官方博客(网页)66

    vLLM-Omni 部署与优化多阶段 Qwen3-Omni 的实践经验

    vLLM-Omni 针对 Qwen3-Omni 提出了涵盖阶段拆分、CUDA Graph、异步分块传输、异步输出与按需副本扩展的全栈在线推理优化方案。该方案将 Thinker(多模态推理)、Talker(Codec 预测)与 Code2Wav(波形重建)流水线解耦,消除了跨阶段全载荷等待与 Python 调度开销。

    推荐理由:文章拆解了语音多模态模型分阶段推理的延迟瓶颈,所提出的异步流水线与阶段级扩展方案可直接迁移至同类实时全模态架构。

  25. vLLM 官方博客(网页)70

    vLLM 官方首发支持 1T 多模态模型 TML Inkling

    vLLM 宣布首发支持 Thinking Machines Lab 推出的 1T 参数原生多模态模型 TML Inkling,覆盖 NVFP4 与 BF16 两个版本,原生支持文本、图像与音频输入及最高 1M 上下文。

    推荐理由:框架通过短卷积分片与通信融合等算子优化完成了万亿多模态模型适配,为超大模型长上下文推理提供了工程参考。

  26. vLLM 官方博客(网页)67

    vLLM Semantic Router 升级架构:从智能路由演进为 Mixture-of-Models 系统引擎

    vLLM Semantic Router 宣布从单一请求路由演进为构建、评测和运行 Mixture-of-Models(MoM)的系统引擎,对外提供统一的模型交互接口。

    推荐理由:文章阐明了将分散的独立大模型封装为统一 MoM 系统的架构设计,读者可以了解跨硬件和多模型协同调度的工程实现路径。

  27. vLLM 官方博客(网页)73

    vLLM 预览 Kimi K3 生产级推理支持:重构 KDA 前缀缓存并优化 MXFP4 MoE

    vLLM 宣布将为月之暗面(Moonshot AI)预计 7 月 27 日开源的 2.8T 参数模型 Kimi K3 提供 Day-0 生产级推理支持。针对 KDA 循环注意力机制,vLLM 将物理状态块大小与前缀匹配粒度解耦,实现了细粒度前缀缓存命中与写时复制。

    推荐理由:文章详细拆解了针对 KDA 循环注意力与 MXFP4 MoE 的前缀缓存重构及算子优化,读者可据此了解超大混合架构在开源引擎中的工程落地细节。

  28. vLLM 官方博客(网页)73

    vLLM 在 24 张 NVIDIA B300 上部署优化 GLM-5.2:TPOT 从 40ms 降至 17ms

    DaoCloud 团队在 vLLM 官方博客分享了在 24 块 NVIDIA B300 GPU 上部署 GLM-5.2-NVFP4 的生产级优化实践,采用 4P1D 的 P/D 分离拓扑将平均 TPOT 从 40ms 降至 17ms,达成 TTFT ≤ 2.5s 与 TPOT ≤ 20ms 的 SLA 目标。

    推荐理由:文章详细拆解了超大 MoE 模型在长上下文与投机解码下的端到端调优路径,给出了完整的部署配置与长周期排障经验。

  29. vLLM 官方博客(网页)81

    vLLM 宣布首日支持月之暗面 Kimi K3

    vLLM 宣布首日支持月之暗面 2.8T 参数模型 Kimi K3,提供混合 KDA 前缀缓存与 DSpark 投机解码等生产级部署方案。在 16 卡 NVIDIA GB300 NVL72 上配合 DSpark 投机解码单用户吞吐可达 370 tok/s,解码速度提升 3.14 倍。

    推荐理由:文章详细拆解了针对超大混合架构模型的缓存改造与投机解码方案,为同类长上下文 MoE 的高效部署提供了完整参考。

  30. vLLM 官方博客(网页)65

    vLLM 与 Speculators 支持 P-EAGLE、DFlash 和 DSpark 并行推测解码算法

    Speculators 与 vLLM 宣布全面开源支持 P-EAGLE、DFlash 和 DSpark 三种并行推测解码算法,摆脱了 EAGLE-3 等传统框架自回归逐词生成候选 token 的延迟瓶颈。

    推荐理由:原文解析了三种并行推测解码架构与训练优化机制,为大模型在线服务降低草稿延迟与参数调优负担提供了工程参考。

  31. Hacker News · AI65

    Modal 推出 AI-SQL 推理引擎 Quail,多表关联查询吞吐达 vLLM 的 10 倍以上

    Modal 与卡内基梅隆大学联合推出专为 AI-SQL 负载设计的推理层 Quail(QUery-Aware Inference Layer),通过联合优化查询规划器与推理引擎提升分析型数据库中的大模型吞吐。

    推荐理由:原文针对分析型数据库中的大模型推理负载,通过联合查询规划与缓存管理协同优化,为高吞吐纯 Prefill 场景提供了可借鉴的架构方案。

  32. Cerebras 官方博客(网页)70

    Cerebras 联合 OpenAI 推出 Ultrafast Mode:驱动 GPT-5.6 Sol 达到每秒 750 Token

    Cerebras 与 OpenAI 联合推出由 Cerebras 晶圆级架构驱动的 Ultrafast Mode,GPT-5.6 Sol 在该模式下输出速度最高可达 750 output tokens per second。

    推荐理由:原文给出了 Cerebras 驱动大模型超高速推理的实测吞吐与基准耗时,读者可以据此判断高吞吐推理对实时智能体交互的改进幅度。