vLLM 引入 DSpark 自适应验证机制:动态调度投机解码预算
vLLM 在 PR #47808 中合并了 DSpark 自适应验证功能(enable_adaptive_verification),通过置信度预测头动态调度草稿验证预算,使投机解码在并发度 1 至 256 下均保持在吞吐与延迟的帕累托前沿。
vLLM 在 PR #47808 中合并了 DSpark 自适应验证功能(enable_adaptive_verification),通过置信度预测头动态调度草稿验证预算,使投机解码在并发度 1 至 256 下均保持在吞吐与延迟的帕累托前沿。
LlamaIndex 面向金融机构推出 AI 智能体解决方案,支持基于合同、监管备案文件与研究报告构建端到端自动化工作流。方案结合 LlamaParse 针对复杂图表和嵌套表格的解析能力,覆盖投资研究分析、KYC/AML 校验、合同条款提取及审计风控报告四大场景。系统提供置信度评分与引用溯源,支持通过 API 和仪表盘进行调用与监控。
Claude 正式推出 Skills 功能,允许用户与企业将专业知识、业务规范及最佳实践封装为结构化资源,在 Claude.ai、Claude Code 与 API 间跨平台通用。开发者只需构建包含 SKILL.md 指引、参考资料及脚本的文件夹,或通过内置的 skill-creator 自动生成,Claude 即可在复杂任务中自动组合并调用对应技能。
推荐理由:原文明确了用文件夹和元数据打包组织流程的标准格式,读者可以据此将团队制度沉淀为跨客户端与接口通用的智能体能力。
vLLM-Omni 推出分布式分层卸载(DLO)技术,通过 Meta 设备与 mmap 加载、权重切分重构、双缓冲预取以及数据并行多并发,使单卡显存不足的超大视频生成模型可在多卡 GPU 或 NPU 上高效运行。
推荐理由:vLLM-Omni 结合 mmap 与多流 AllGather 卸载降低显存与内存峰值,为大参数量扩散模型的低成本分布式推理提供了落地路径。
LlamaIndex 推出基于 AI 智能体的保险自动化解决方案,用于处理发票分类、表单录入与合规审查等繁重文档任务。该方案依托 LlamaParse 解析包含图表的复杂文档,涵盖理赔助手、合规跟踪、保单解答及欺诈监测四大功能,并提供 Python 与 TypeScript SDK 及 API。
Claude 推出插件市场(Claude Marketplace),聚合了 340 款整合工具、技能与集成的插件并支持一键安装。市场覆盖了 GitHub、Microsoft Playwright、Vercel、Supabase、Figma 等官方 MCP 服务与开发套件,支持在 Claude Code 中完成代码审查、浏览器自动化测试、云端部署与设计稿转代码等任务。
推荐理由:原文给出了插件市场的具体分类与集成工具清单,读者可以据此评估将外部开发工具接入工作流的可行性。
VeRL-Omni 正式发布 v0.2.0 版本,重点提升扩散模型与全模态强化学习的训练吞吐与系统稳定性。
推荐理由:该版本通过请求级批处理和标准化适配器,解决了扩散模型与全模态大模型强化学习中高延迟和架构耦合的问题。
LlamaIndex 推出面向金融分析的 AI 解决方案,利用 LlamaParse 高精度解析复杂财报 PDF、图表与嵌套表格,可减少 80% 的研究时间。系统支持自动提取营收、FCF 等关键指标,快速完成 10-K/10-Q 报告摘要、尽职调查与趋势分析,并构建专属 AI 智能体。平台还提供 Python 与 TypeScript SDK 及 API,支持可追溯引用与企业级并行处理。
Claude Marketplace 汇集了 867 个连接器与插件,支持将外部工具直接接入 Claude 对话。平台支持前端代码生成、子智能体开发与代码审查、Upstash Context7 实时文档检索、微软 Playwright 浏览器自动化端到端测试以及 monday.com 项目管理等功能。
推荐理由:原文给出了连接器生态与典型 MCP 服务能力,读者可以据此了解工具集成支持的开发和自动化场景。
Anthropic 在 Claude 平台及 Claude Code 中正式推出 Claude Design 功能,支持用户通过自然语言描述并结合自有设计系统直接生成符合品牌规范的视觉设计、单页企划与可交互流程原型。
推荐理由:Anthropic 官方介绍了该功能如何接入企业设计系统与代码库,读者可以据此评估它对前端原型与营销设计协作流程的改变。
SkyRL 引入跨框架统一执行抽象 IsoExec,通过统一执行契约与对齐的批次无关算子,消除 vLLM 推理引擎与 Megatron 训练引擎之间的数值执行不一致。在单台 8×H100 节点运行 Qwen3.5-35B-A3B 同步 DAPO 训练时,IsoExec 将采样与训练间的平均 logprob 差异降至 1e-6 以下,50 步内的额外开销为 25%。
LlamaIndex 基于 LlamaParse 与 AI 智能体工作流推出行政运营方案,旨在消除发票匹配、表单录入与合同审查等手动流程,释放 80% 的时间。该方案提供发票评估、合同提取与表单处理等模块,并配备 Python 和 TypeScript SDK 与 API。系统支持解析复杂图表和表格,提供字段溯源与置信度评分,适用于高合规性企业 RAG 管道。
Claude 宣布在付费计划中上线 Claude Design、Claude Slides 和 Claude Docs 测试版,支持在对话旁直接生成可交互的视觉设计、演示文稿和动态文档。
推荐理由:官方全面介绍了 Design、Slides 和 Docs 三类新组件的功能细节与权限机制,有助于评估其对现有办公协作流程的改造潜力。
vLLM 联合 NIXL 团队推出了基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 台 8×H100 节点集群上实现 Kimi K2 模型 BF16 格式 7.9TB 权重在 7.53 秒内完成同步,聚合带宽达 1,049 GB/s。
推荐理由:针对在线强化学习超大 MoE 权重同步慢且显存开销高的问题,该方案通过分片点对点拉取与流水线重叠优化提供了高效的训推协同实践路径。
LlamaIndex 针对工程与研发场景推出解决方案,通过加速技术文档理解将产品开发周期缩短 80%。该方案依托 LlamaParse 解析包含图表和嵌套表格的复杂多模态文档,支持构建研发助手、系统架构问答与技术规范对比等 AI 智能体工作流。平台提供 Python 和 TypeScript SDK 及 API,已被 Salesforce Agentforce 等团队用于落地企业级 RAG 应用。
Anthropic 推出面向科研人员的 AI 工作台应用 Claude Science 并开启公测,支持在本地、集群或 GPU 上运行数据分析与作业调度。该应用可原生查看蛋白质与分子结构,直连 60 余个科学数据库及 NVIDIA BioNeMo 工具链,并支持通过 MCP 连接外部工具。每次分析生成的图表与结论都会绑定完整代码、运行环境与对话记录,以便后续复现与核验。
推荐理由:原文详细展示了面向生命科学的数据分析、算力编排与可追溯工作流,读者可据此评估其对科研实验及生信管线的适配度。
vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。
推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。
LlamaIndex 团队开源本地文档解析工具 LiteParse,支持在无云端依赖且不消耗模型 token 的情况下快速解析 PDF、Office 文档及图像。该工具采用嵌入文本结构化结合传统 OCR 的混合方案,能够输出带有精确边界框坐标的结构化 JSON 数据。LiteParse 提供命令行工具与 Python 包,支持跨核心扩展与批量处理,便于直接接入 AI 智能体与向量数据库工作流。
推荐理由:该工具无需调用大模型即可在本地快速解析多格式文档并保留边界框坐标,为构建低成本 RAG 与 Agent 工作流提供了轻量开源方案。
vLLM-Omni 宣布完成对 MiniMax H3 的全栈推理优化并集成 FastVideo 的 4 步蒸馏方案 FastH3,实现了生成速度快于播放时长的端到端实时服务。
推荐理由:文章拆解了音视频联合生成从 DiT 到 VAE 及视频封装的全链路瓶颈,为多模态大模型的低延迟部署提供了系统级参考。
Claude Security 现面向 Claude Enterprise 客户开启公测,基于 Claude Mythos 5.1 扫描代码库并提供经对抗性验证的漏洞补丁建议。
推荐理由:原文展示了结合大模型跨文件推理与对抗性验证的代码漏洞挖掘流程,为企业自动化代码审查提供了参考。
LlamaIndex 提供 Index 功能,通过智能切块与嵌入向量处理让数据支持高精度的大规模检索。平台目前已累计处理超过 1B 份文档,每月安装包下载量超 25M 次,LlamaParse 用户突破 300k。该功能支持多模态索引与数据增量同步,并可直接对接 AI 智能体实现下游工作流自动化。
vLLM 正式推出 vLLM TT Plugin,通过树外平台插件机制将 Tenstorrent 硬件接入 vLLM 推理生态,对外保持兼容 OpenAI 格式 API。
推荐理由:文章详细展示了非 GPU 网格架构适配 vLLM 的工程实践,为异构芯片接入主流推理框架提供了调度与并行设计参考。
Anthropic 推出 Slack 端智能体 @Claude 测试版,面向 Claude Enterprise 和 Team 客户开放,并计划支持 Microsoft Teams。
推荐理由:原文展示了智能体以独立身份融入团队协同工作流的形态,读者可以借此了解企业内协作型智能体的落地方式。
LlamaIndex 旗下文档提取工具 LlamaExtract 支持从复杂文档中提取结构化数据,并提供字段级置信度评分与来源引用追溯。该工具结合版面与上下文感知推理,支持用户自定义或自动检测 Schema,且具备多种解析模式以平衡成本与准确率。目前平台已处理超 10 亿份文档,LlamaParse 用户数超 30 万。
vLLM 针对多轮会话、长上下文及高前缀复用的 Agent 工作负载推出全栈推理优化方案,涵盖统一内存页混合 KV cache 管理、分层离线卸载、模型自适应并行及防队头阻塞调度。
推荐理由:原文梳理了长上下文与高前缀复用负载下的全栈推理优化方案,为大模型智能体部署和算力选型提供了实测参考。
LlamaIndex 旗下的 LlamaParse 可将复杂排版、表格、图表、手写内容及图像等转化为干净的 Markdown 格式。它具备版面感知与多模态解析能力,开箱支持 100+ 种语言,并提供本地云部署与高并发等企业级支持。目前该工具累计处理文档超 1B+,月度包下载量超 25M+,用户规模达 300k+。
Anthropic 推出代码智能体工具 Claude Code,支持在终端、IDE、Slack 或网页端协同工作,能够自主处理 Bug 修复、跨文件重构与长期代码迁移等研发任务。
推荐理由:官方全面介绍了这款代码智能体的终端定位与长流程处理能力,方便开发者评估其接入现有开发栈的实际价值。
vLLM 针对 GLM 5.3 推出 Hybrid HiSparse 混合稀疏卸载优化机制,使单个 8× H200 节点即可运行 100 万全长上下文并显著提升并发能力。
推荐理由:文章给出了混合稀疏卸载机制在单节点上的显存管理设计,为长上下文大模型推理的高并发部署提供了实用方案。
LlamaParse 提供端到端 AI 文档理解方案,具备 Parse 复杂版面与图表解析、Extract 上下文数据提取(含置信度分数与引用)以及 Index 智能分块与嵌入检索能力。该工具专注于复杂表格与层级文档处理,已应用于 Salesforce Agentforce 等团队的企业级 RAG 和 AI 智能体开发,有效降低了数据管道的维护成本。
Anthropic 升级 Claude 产品定位与功能体系,将其从对话问答扩展为可接管长任务与多应用工作流的协作智能体,并将 Claude Cowork 与 Chat 整合为统一体验。
推荐理由:官方整合了对话与工作流执行能力,展示了从单轮问答向多工具协同和长任务接管的具体落地形态。
LlamaIndex 正式发布开源企业级文档提取评测基准 ExtractBench,并同步推出文档提取服务新层级 LlamaExtract Agentic Plus。
推荐理由:原文同时评估了提取准确率、长文档衰减与单页成本,读者可以据此对比不同模型在实际企业文档提取中的性价比与能力边界。
vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。
推荐理由:框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。
vLLM 针对 AMD Instinct MI355X 优化 MiniMax M3 推理性能,在并发 32 下将 MXFP8 吞吐提升 3.14 倍至 342.4 output tokens/s/GPU。
vLLM 宣布针对 Kimi K3 模型完成全栈推理性能优化,在 B300 节点 8K/1K 负载下实现端到端吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%,平均延迟降低 56%–60%。
推荐理由:原文给出了从自适应调度、KDA 检查点到 ReplaySSM 的全栈优化细节,读者可据此参考混合架构大模型推理加速方案。
vime、RL-Kernel 与 AMD 合作在 ROCm 上实现了 Megatron 训练与 vLLM rollout 的逐比特数值一致性。在 8× AMD Instinct MI300X 运行的 Qwen3-8B GRPO 端到端实验中,系统连续 200 步实现 mismatch_count = 0 且 max_abs_diff = 0。
Novita AI 开源了面向 Kimi K2.x 等模型的高性能 W4A16 MoE CUDA 算子 Chord,并接入 vLLM 的 Humming 量化后端。
vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。
推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。
vLLM 宣布集成 PyNvVideoCodec 以支持 NVIDIA GPU 硬件视频解码(NVDEC),将视频解码工作负载从 CPU 转移至专用硬件。该方案消除了多 GPU 节点运行视觉语言模型时 CPU 易满载的瓶颈,在 8×H100 配置下使视频描述任务的吞吐量达到 CPU 解码方案的两倍以上。
推荐理由:通过将视频解码从 CPU 卸载至 GPU 硬件解码器,解决了多卡视觉模型推理中的预处理瓶颈并给出了部署配置参考。
vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。
推荐理由:文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。
vLLM 官方发布 vllm-metal,将 vLLM 的 V1 调度器、分页 KV 缓存和连续批处理服务栈引入 Apple Silicon,底层结合 MLX 与 Metal 执行。
推荐理由:原文给出了将 vLLM 分页调度栈移植到 Apple Silicon 的架构与内核实现,读者可以据此评估 Mac 本地多智能体并发推理的性能与部署方案。