跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 41–60 条 · 共 131 条
9月30日周三
  1. vLLM 官方博客(网页)67

    vLLM Semantic Router 升级架构:从智能路由演进为 Mixture-of-Models 系统引擎

    vLLM Semantic Router 宣布从单一请求路由演进为构建、评测和运行 Mixture-of-Models(MoM)的系统引擎,对外提供统一的模型交互接口。

    推荐理由:文章阐明了将分散的独立大模型封装为统一 MoM 系统的架构设计,读者可以了解跨硬件和多模型协同调度的工程实现路径。

  2. vLLM 官方博客(网页)73

    vLLM 预览 Kimi K3 生产级推理支持:重构 KDA 前缀缓存并优化 MXFP4 MoE

    vLLM 宣布将为月之暗面(Moonshot AI)预计 7 月 27 日开源的 2.8T 参数模型 Kimi K3 提供 Day-0 生产级推理支持。针对 KDA 循环注意力机制,vLLM 将物理状态块大小与前缀匹配粒度解耦,实现了细粒度前缀缓存命中与写时复制。

    推荐理由:文章详细拆解了针对 KDA 循环注意力与 MXFP4 MoE 的前缀缓存重构及算子优化,读者可据此了解超大混合架构在开源引擎中的工程落地细节。

  3. vLLM 官方博客(网页)73

    vLLM 在 24 张 NVIDIA B300 上部署优化 GLM-5.2:TPOT 从 40ms 降至 17ms

    DaoCloud 团队在 vLLM 官方博客分享了在 24 块 NVIDIA B300 GPU 上部署 GLM-5.2-NVFP4 的生产级优化实践,采用 4P1D 的 P/D 分离拓扑将平均 TPOT 从 40ms 降至 17ms,达成 TTFT ≤ 2.5s 与 TPOT ≤ 20ms 的 SLA 目标。

    推荐理由:文章详细拆解了超大 MoE 模型在长上下文与投机解码下的端到端调优路径,给出了完整的部署配置与长周期排障经验。

  4. vLLM 官方博客(网页)81

    vLLM 宣布首日支持月之暗面 Kimi K3

    vLLM 宣布首日支持月之暗面 2.8T 参数模型 Kimi K3,提供混合 KDA 前缀缓存与 DSpark 投机解码等生产级部署方案。在 16 卡 NVIDIA GB300 NVL72 上配合 DSpark 投机解码单用户吞吐可达 370 tok/s,解码速度提升 3.14 倍。

    推荐理由:文章详细拆解了针对超大混合架构模型的缓存改造与投机解码方案,为同类长上下文 MoE 的高效部署提供了完整参考。

  5. vLLM 官方博客(网页)65

    vLLM 与 Speculators 支持 P-EAGLE、DFlash 和 DSpark 并行推测解码算法

    Speculators 与 vLLM 宣布全面开源支持 P-EAGLE、DFlash 和 DSpark 三种并行推测解码算法,摆脱了 EAGLE-3 等传统框架自回归逐词生成候选 token 的延迟瓶颈。

    推荐理由:原文解析了三种并行推测解码架构与训练优化机制,为大模型在线服务降低草稿延迟与参数调优负担提供了工程参考。

  6. Hacker News · AI65

    Modal 推出 AI-SQL 推理引擎 Quail,多表关联查询吞吐达 vLLM 的 10 倍以上

    Modal 与卡内基梅隆大学联合推出专为 AI-SQL 负载设计的推理层 Quail(QUery-Aware Inference Layer),通过联合优化查询规划器与推理引擎提升分析型数据库中的大模型吞吐。

    推荐理由:原文针对分析型数据库中的大模型推理负载,通过联合查询规划与缓存管理协同优化,为高吞吐纯 Prefill 场景提供了可借鉴的架构方案。

  7. TechCrunch AI87

    OpenAI 发布 GPT-6.1 Sol:性能接近 GPT-6 Astra 且价格更低

    OpenAI 在 DevDay 活动上正式发布 GPT-6.1 Sol 模型,称其在智能体编码、计算机操作及专业工作上的智能水平接近 GPT-6 Astra,而标准输入与输出 token 价格仅为后者的五分之一。

    推荐理由:新模型以五分之一的价格提供接近旗舰模型的智能水平,并改进了低推理强度下的事实准确率与安全遵从度。

  8. Cerebras 官方博客(网页)70

    Cerebras 联合 OpenAI 推出 Ultrafast Mode:驱动 GPT-5.6 Sol 达到每秒 750 Token

    Cerebras 与 OpenAI 联合推出由 Cerebras 晶圆级架构驱动的 Ultrafast Mode,GPT-5.6 Sol 在该模式下输出速度最高可达 750 output tokens per second。

    推荐理由:原文给出了 Cerebras 驱动大模型超高速推理的实测吞吐与基准耗时,读者可以据此判断高吞吐推理对实时智能体交互的改进幅度。

  9. Cerebras 官方博客(网页)77

    Cerebras 如何实现 GPT-5.6 Sol 高达每秒 750 tokens 的高速推理

    Cerebras 通过其 WSE-3 晶圆级芯片支持 OpenAI GPT-5.6 Sol 的 Ultrafast 模式,在不降低精度、不蒸馏且不改变权重的条件下实现了高达 750 output tokens/s 的推理速度。

    推荐理由:文章详细拆解了晶圆级芯片利用片上超大带宽 SRAM 消除显存墙以实现高速大模型推理的硬件架构与工程实现。

  10. Cerebras 官方博客(网页)68

    Cerebras 发布第四代 AI 系统 CS-4:推理速度最高达 GPU 的 30 倍并支持解耦架构

    Cerebras 正式发布第四代 AI 加速系统 CS-4,搭载三颗 Wafer Scale Engine 3 Turbo 处理器并采用全新 Nexus 机柜架构,官方称其推理速度最高可达 GPU 系统的 30 倍。

    推荐理由:CS-4 将晶圆级算力与解耦推理结合,为十万亿参数超大模型的交互式生成提供了不同于传统集群的低延迟硬件方案。

  11. Claude 官方博客(网页)84

    Anthropic 发布 Claude Haiku 4.5 模型

    Anthropic 正式推出 Claude Haiku 4.5,在编码、电脑使用及智能体任务上达到 Sonnet 4 水平,并在 SWE-bench Verified 基准测试中取得 73.3% 的成绩。

    推荐理由:原文对比了该轻量模型与旗舰版本的编码和推理表现,读者可以据此评估多智能体协作与大规模调用的性价比边界。

  12. Claude 官方博客(网页)89

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 正式推出 Claude Sonnet 5.5 混合推理模型,具备 1M 上下文窗口,运行速度相比 Sonnet 5 提升 30% 且典型工作流成本降低最高达 30%。

    推荐理由:官方公布了新模型的定价与多场景实测数据,开发者可以据此评估高频编码与 Agent 任务的替换成本。

  13. vLLM 官方博客(网页)77

    vLLM 详解解码上下文并行 DCP:长上下文智能体推理吞吐提升 3 倍

    vLLM 官方详解了解码上下文并行(DCP)机制,通过沿序列维度将 KV Cache 分片到多张 GPU,在长上下文智能体负载下实现相比标准张量并行 3 倍的吞吐提升。

    推荐理由:针对长上下文推理中多头及潜变量注意力导致的显存冗余,原文给出了按序列分片提升并发与吞吐的实现方案。

  14. vLLM 官方博客(网页)75

    vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型推理

    vLLM 宣布首日支持 NVIDIA Nemotron 3.5 Lightning 模型,提供兼容 OpenAI 的 API 接口及完整的高吞吐推理部署方案。该模型采用 30B 总参数、3B 激活参数的混合 MoE 架构,支持 100 万 token 上下文并提供 BF16 与 NVFP4 权重。

    推荐理由:文章提供了在多种硬件平台上利用投机解码加速运行该智能体模型的完整部署配置与调优方法。

  15. vLLM 官方博客(网页)79

    vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型推理

    vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型,提供开箱即用的推理服务。该模型为 2.4T 参数的稀疏混合专家(MoE)架构,包含 512 个专家并采用全注意力与线性注意力的混合主干。除官方 FP8 和 BF16 权重外,vLLM 还支持 NVFP4 与 MXFP4 量化版本,可在单节点 NVIDIA B300 或 AMD MI355X 上完成高效推理。

    推荐理由:原文提供了超大混合专家模型的推理部署命令与多硬件算子优化细节,便于工程团队评估大模型服务资源。