vLLM 推出分层 KV Cache 卸载框架
vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。
推荐理由:框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。
推荐理由:框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。
vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。
推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。
vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。
推荐理由:文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。
vLLM 官方发布 vllm-metal,将 vLLM 的 V1 调度器、分页 KV 缓存和连续批处理服务栈引入 Apple Silicon,底层结合 MLX 与 Metal 执行。
推荐理由:原文给出了将 vLLM 分页调度栈移植到 Apple Silicon 的架构与内核实现,读者可以据此评估 Mac 本地多智能体并发推理的性能与部署方案。
vLLM 官方博客发布技术长文深度剖析其 V1 推理引擎,系统拆解从单卡底层内核到大规模分布式服务的完整架构。文章详细解读了调度器运行机制、PagedAttention 内存分配与连续批处理流程,并深入探讨分块 Prefill、前缀缓存、基于有限状态机的引导解码、推测解码以及 Prefill/Decode 分离等高级特性。
推荐理由:文章从单机引擎内核层层拆解到多节点分布式服务,为理解和优化高吞吐大模型推理系统提供了完整清晰的架构参考。
Google 宣布与 Speakeasy 合作将 OpenAPI 代码生成套件在 AGPLv3 协议下开源,用于生成多语言 SDK、Agent 原生 CLI 以及文档 MCP 服务端。
推荐理由:原文结合闭源供应商停运的迁移经历,展示了结合确定性生成器与 Agent 维护多语言 SDK 及 MCP 服务的工程实践。
Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。
推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。
AI热点资讯平台 AIHOT 正式开源其 2.0 基础框架与生产环境配置,代码已托管至 GitHub 仓库(KKKKhazix/AIHOT)。本次开源公开了热点采集流程、精选评分流程、聚簇机制以及生产环境使用的全部提示词,信源部分则留给用户自定义接入;该版本经 AI 重构后实现了组件化与模块解耦,旨在为各行业开发者提供通用的垂直资讯监控与 Agent 开发框架。
推荐理由:原文开放了热点采集、评分与聚类等完整流程及生产环境提示词,其他行业读者可以据此复用并搭建垂直领域的资讯监控工具。
AI 安全测试机构 Mindgard 发现月之暗面(Moonshot)旗下的 Kimi K2.6 与 K3 Swarm 模型可被越狱绕过安全护栏,诱导输出制造生物武器和暗杀等敏感内容。Mindgard 指出越狱后的模型还可能被黑客利用在算力资源上运行代码并联网,从而成为网络攻击跳板;月之暗面表示正就相关发现展开沟通与内部审查,并强调其模型在内部评估中对此类请求保持了高拒绝率。
推荐理由:原文披露了针对开源权重模型的越狱测试与潜在滥用场景,读者可据此评估大语言模型安全护栏与对齐机制面临的实际挑战。
开源基准项目 Livenerf 正式上线,旨在通过长期连续测试量化监测 Claude Opus 5.5 发布后是否出现能力削弱或暗中降级。该工具基于英国人工智能安全研究所的 Inspect 框架,通过固定版本的 Claude Code 命令行接口与冻结提示词,每日在筛选出的 78 道边界题目上运行测试并统计准确率与输出 token 变化。
推荐理由:该项目通过固定题目与预注册统计协议,为大模型发布后是否暗中削弱的争议提供了可复现的长期量化基准。
Ollama 发布 v0.35.0 版本,通过 /v1/systemone 接口新增对决策模型的支持。该功能基于 TypeSafe 的 Jev API,使模型直接返回选项、概率和分值而非生成文本,适用于工单分拣、模型路由和内容分类等场景,首批支持 Nimble 和 Tev1 模型。新版本还修复了 MLX 模型下载挂起的问题,并优化了设置加载与已弃用参数的告警处理。
推荐理由:原文给出了决策模型的调用接口与结构化返回示例,展示了本地运行时从文本生成拓展至精准分类与路由的能力。
Anthropic 发布对智谱 GLM-5.3 的网络安全能力评估,指出该开源权重模型具备较强的端到端漏洞挖掘与利用能力,在 ExploitBench 上 410 次尝试中成功构建 50 次完整利用链。
推荐理由:报告通过实测对比了开源权重模型在自动化漏洞利用中的攻防边界,为评估前沿模型滥用风险提供了具体基准。
NVIDIA 正式开源表格基础模型 Kumo Tabular,支持在无需训练、微调或特征工程的前提下,通过单次前向传播直接完成表格数据的分类与回归预测。该模型包含 28M 到 215M 三种参数规模,完全基于结构因果模型生成的合成数据完成预训练,并在 TabArena、BeyondArena、TALENT 与 ScoringBench 四项基准测试中均位居榜首。
推荐理由:模型展示了完全依赖因果合成数据预训练表格大模型的可行路径,读者可以借此了解免微调与零特征工程在表格预测任务中的落地机制。
GitHub Security Lab 介绍了利用开源 Taskflow Agent 审计 Android 应用并挖掘出 24 个漏洞的实践方法与案例。研究人员通过拆分识别入口点与定向排查漏洞两类 YAML 提示词工作流,成功发现了 OsmAnd 隐私追踪和维基百科应用账户接管等高危漏洞。
推荐理由:文章分享了利用分步任务流引导大模型挖掘移动端漏洞的实操流程,并客观指出了模型评估漏洞严重性时的局限。
Stacklok 宣布开源云原生 AI 智能体框架 Mecatl,将核心 Agent 循环与客户端、执行环境、工具系统及会话存储解耦,支持在 Kubernetes 等分布式环境中弹性部署与滚动更新。
推荐理由:文章阐述了将智能体运行循环与执行环境和会话存储解耦的云原生架构设计,为大规模多租户部署提供了工程参考。
NVIDIA 联合 Google DeepMind 及 EMBL-EBI 等机构,通过 AlphaFold Database 公开发布了超过 2800 种病毒的蛋白质复合物预测 3D 结构数据集。
推荐理由:NVIDIA 联合 DeepMind 等机构开源 2800 多种病毒的蛋白质复合物 3D 结构数据与预测管线,为应对潜在疫情提供了关键的生物计算基础设施。
NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。
推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。
推理框架 vLLM 正式发布 v0.30.0 版本,新增对 DeepSeek-V4.1-Flash、GLM-5.3-Flash 等新架构模型的端到端支持。核心更新引入支持 FP4 与多机 TP 的 Fast Start 显存权重缓存守护进程,大幅缩短引擎重启与初始化耗时;同时上线 HiSparse 分层稀疏 MLA 解码机制,并深度优化了投机解码、上下文并行及 NVFP4 量化性能。
推荐理由:该版本通过显存权重常驻守护进程与稀疏解码分层卸载,为大模型长上下文与高并发推理提供了可迁移的部署优化方案。
英国人工智能安全研究所(UK AISI)正式采用 EvalEval 基础设施公开基准评测结果,利用 Evaluation Cards 平台与统一的 EEE 规范提升评测的可复现性与透明度。
推荐理由:通过统一元数据和运行配置公开评测记录,为行业对比前沿模型评测差异提供了标准化的复现参考。
Hugging Face 在 Transformers 库中新增对 GGUF 量化格式的原生高效推理支持,用户可通过标准 from_pretrained API 直接加载 Hub 上的 GGUF 模型并在本地运行。
推荐理由:原文展示了在 PyTorch 生态中直接加载 GGUF 权重的实现路径,让开发者无需脱离 Transformers 工作流即可兼顾端侧推理性能。