AIDC
DC AI 热点

全部 AI 动态

9月22日2026-09-22
vLLM 更新✦ 精选AI 评分 75/10013:20

大模型推理框架发布 v0.30.0 版本:新增 DeepSeek-V4.1、GLM-5.3 等多款模型及优化支持

开源大模型推理框架发布 v0.30.0 版本更新,包含来自 315 位贡献者的 762 次提交。新版本支持了多款前沿大模型及架构优化,包括支持 MXFP8 格式 KV 缓存与 FlashMLA 的 DeepSeek-V4.1-Flash、支持 ROCm 与 LoRA 的 DeepSeek-V4-Flash-Vision-Exp、支持 EPLB 的 GLM-5.3-Flash,以及 K2-Horizon、Cohere Compass、Bailing V3 VL 等,并引入了基于 AVX512/AMX 的 CPU 后端支持。

阅读原文 ↗推荐理由:包含 DeepSeek-V4.1、GLM-5.3 等最新模型的推理支持及 FlashMLA、MXFP8 等底层算力优化特性。# 大模型# 推理# 开源# 算力# 多模态
Hugging Face✦ 精选AI 评分 75/10008:00

Transformers 现已支持直接运行 llama.cpp 量化模型

Hugging Face 旗下核心框架 Transformers 现已支持直接加载和运行 llama.cpp 的量化格式模型。该功能进一步融合了主流开源推理生态,允许开发者在 Transformers 生态内直接使用经过 llama.cpp 极限量化的模型权重,大幅降低本地推理的显存占用并提升部署灵活性。由于输入信息较少,详细支持范围与参数请参阅官方更新说明。

阅读原文 ↗推荐理由:打通了主流开源大模型框架与轻量化量化格式的生态壁垒,极大便利了开发者的低成本部署。# 大模型# 开源# 模型压缩# 推理# Hugging Face
Anthropic 官方动态(网页)✦ 精选AI 评分 75/10008:00

Anthropic 推出 Claude Opus 5.5 模型

根据提供的新闻标题,Anthropic 或相关方发布了新一代旗舰大模型 Claude Opus 5.5。由于当前输入素材未提供详细摘要和正文内容,关于该模型的具体架构改进、性能评测基准、上下文窗口以及上线部署情况等细节信息暂不明确。

阅读原文 ↗推荐理由:涉及头部大模型系列 Claude Opus 的新版本发布动态,具备较高行业关注度。# 大模型# Claude# Anthropic# 推理# 自然语言处理
Simon Willison✦ 精选AI 评分 72/10007:09

TypeSafe AI 推出决策模型 Jev:专注概率决策输出的新型大模型形态

TypeSafe AI 近期发布了名为 Jev 的新型模型,将其定义为“系统一模型”(System One)或“决策模型”。与传统大模型输出文本不同,Jev 虽接收非结构化文本输入,但直接返回代表分类、是非判断、评级及置信度的浮点数,实现“输入非结构化状态,输出类型化概率决策”。该模型类似前沿智能函数调用,相比传统大语言模型具有更快的响应速度和更低的成本。

阅读原文 ↗推荐理由:展示了一种跳脱出传统文本生成的全新决策模型范式,为低成本、高速度的结构化推理提供了新方向。# 大模型# 推理# TypeSafe AI
NVIDIA Developer Blog✦ 精选AI 评分 72/10005:51

英伟达在Dynamo-Triton中集成TensorRT多设备推理,简化多GPU模型部署服务

随着生成式AI对计算与显存的需求不断超出单卡上限,英伟达推出TensorRT多设备推理新功能,并将其集成至NVIDIA Dynamo-Triton中。该方案旨在简化跨多个GPU的大模型推理服务部署流程,有效降低多卡分布式推理的工程复杂度,提升大规模生成式AI模型在多GPU环境下的服务效率与吞吐能力。

阅读原文 ↗推荐理由:英伟达针对多卡推理服务集成新功能,有助于降低大模型分布式推理部署的工程门槛。# 英伟达# 推理# 算力# 大模型
AWS 机器学习✦ 精选AI 评分 75/10002:30

xAI旗下Grok 4.6正式上线Amazon Bedrock平台

xAI的前沿模型Grok 4.6现已正式登陆Amazon Bedrock平台。该模型专为长时间运行的智能体、编程和知识型工作设计,配备500K token的超长上下文窗口,并提供四个推理努力等级。用户可通过bedrock-mantle和bedrock-runtime端点调用,并获得Converse API及跨区域推理功能支持。

阅读原文 ↗推荐理由:xAI核心模型接入主流云服务商AWS Bedrock,标志着其商业化与生态分发进一步拓展。# xAI# 大模型# 智能体# 推理# AI编程
AWS 机器学习✦ 精选AI 评分 68/10000:34

Positron 集成至 Amazon SageMaker AI,支持统一数据科学工作流

Posit 推出的下一代数据科学集成开发环境(IDE)Positron 现已支持在 Amazon SageMaker AI 上运行。在统一且受监管的 SageMaker Studio Space 环境中,数据科学家可结合 Amazon Athena 探索数据,利用 R 语言验证特征,使用 Python 训练 XGBoost 模型,直接部署 SageMaker AI 实时推理终端,并通过 Quarto 生成结果报告,实现多语言端到端工作流协同。

阅读原文 ↗推荐理由:Positron IDE 接入 SageMaker,为 R/Python 多语言数据科学与模型部署提供了统一受管的工作流支持。# AI编程# 亚马逊# 开源# 推理
vLLM 官方博客(网页)✦ 精选AI 评分 68/10000:00

vllm-metal 发布:为苹果芯片带来高并发大模型推理服务支持

vLLM 官方宣布推出 vllm-metal,将 vLLM 的分页机制(PagedAttention)和连续批处理推理服务架构引入 Apple Silicon 设备。该版本旨在提升苹果芯片设备上的高并发推理能力,在面对多智能体并发负载时能提供更稳定的首字生成时间(TTFT),并支持批处理 MTP 等高级特性,优化了 Mac 设备的本地大模型部署体验。

阅读原文 ↗推荐理由:知名大模型推理框架 vLLM 拓展至苹果芯片生态,提升了本地及端侧并发推理效率。# 推理# 端侧AI# 开源# 智能体# 芯片
9月21日2026-09-21
Hugging Face✦ 精选AI 评分 68/10021:44

像物理学家一样剪枝大模型:将层块移除转化为伊辛优化问题

该研究提出了一种从物理学视角出发的大语言模型剪枝新方法,将大模型中的层块移除(Block Removal)形式化建模为伊辛优化问题(Ising Optimization Problem),旨在通过统计物理中的经典优化模型探索更高效、系统化的模型压缩与结构化剪枝方案。注:原始素材仅提供标题,详细算法实现与实验结果待论文正文披露。

阅读原文 ↗推荐理由:将大模型结构化剪枝跨学科建模为物理学伊辛优化问题,提供了创新的模型压缩思路。# 大模型# 模型压缩# 推理# 自然语言处理
IT168 服务器存储 · AI与算力(网页)✦ 精选AI 评分 75/10017:30

Akamai探讨AI推理时代的算力分配与ROI破局

随着全球AI产业逐步从大规模GPU抢购转向关注投资回报率(ROI),AI推理场景的基础设施成本与架构优化成为焦点。在专访中,Akamai云计算首席技术官Jay Jenkins深入探讨了AI算力的分配逻辑、推理阶段的隐性成本、分布式边缘架构在合规方面的价值,以及多智能体时代对底层算力基础设施提出的全新挑战,指引行业从“算力焦虑”走向“算力理性”。

阅读原文 ↗推荐理由:探讨了AI从训练转向推理阶段的算力分配逻辑与ROI优化,分析了分布式云架构对多智能体及推理基础设施的价值。# 算力# 推理# 数据中心# 智能体# Akamai
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

vLLM 基于 GB300 NVL72 实现超大模型 Prefill-Decode 分离推理

该内容介绍了如何使用 vLLM 推理框架在英伟达 GB300 NVL72 硬件系统上,通过 Prefill-Decode(PD)分离架构运行超大规模模型 Qwen3.8-2.4T。该优化方案实现了 5K 吞吐量和 180 交互度指标,文章同时提供了供开发者复现这一推理性能测试结果的具体方法与指引。

阅读原文 ↗推荐理由:展示了在英伟达下一代 GB300 架构上通过 vLLM 实现超大模型高吞吐 PD 分离推理的技术实践。# 推理# 算力# 英伟达# 大模型# 开源
9月19日2026-09-19
Claude Code 更新✦ 精选AI 评分 65/10011:10

Claude Code 发布 v2.1.278:自动模式默认采用服务端分类器且免收分类费

Claude Code 迎来 v2.1.278 版本更新。本次更新将面向 Claude API、企业用户以及 AWS Bedrock、Google Vertex、Foundry 等网关的自动模式(auto mode)默认调整为服务端分类器,不再收取分类器开销费用,并支持通过环境变量配置退出;当发生计费回退时会提供警告。此外,新版本在 /status 状态面板中新增展示项,可直观查看当前会话的自动模式分类器是否在服务端运行。

阅读原文 ↗推荐理由:Claude Code 优化了自动模式的分类机制并免收分类器费用,有助于降低开发者与企业的使用成本。# AI编程# Anthropic# 大模型# 推理
Ollama 更新AI 评分 35/10005:10

v0.34.3-rc0 发布:API 支持暴露模型思考级别与默认配置

该发布候选版本(v0.34.3-rc0)的核心更新为通过 API 接口公开了模型的“思考级别”(thinking levels)及其默认参数设置(PR #18473)。该功能主要用于适配和精细调控具备显式思考过程的大模型推理行为。由于原始素材仅提供单行更新日志,未指明所属具体开源软件项目及更多技术细节,整体信息较为有限。

阅读原文 ↗推荐理由:涉及大模型思考推理参数的 API 支持更新,但素材仅为简略的版本候选更新记录,信息量较少。# 推理# 大模型# 开源
AWS 机器学习✦ 精选AI 评分 75/10004:52

亚马逊云科技回顾 SageMaker AI 2026 年多项推理功能更新

亚马逊云科技(AWS)汇总了 Amazon SageMaker AI 在 2026 年初至今推出的 13 项推理相关更新,涵盖全托管端点与 Amazon SageMaker HyperPod Inference 两大部署路径。重点功能包括推理配置推荐、容量感知实例池、分层 KV 缓存机制,以及预填充与解码解耦(disaggregated prefill and decode)等大模型推理优化技术,旨在提升云端 AI 部署效率并降低算力成本。

阅读原文 ↗推荐理由:系统盘点了 AWS SageMaker 在大模型推理加速与算力资源池化管理方面的前沿落地特性。# Amazon# 推理# 算力# 大模型
NVIDIA Developer Blog✦ 精选AI 评分 68/10003:04

使用 AIPerf 对大规模大语言模型推理进行基准评测

在系统上部署大语言模型后,评估其实际推理速度与性能表现是关键难题。本文介绍了用于大规模大模型推理评测的工具 AIPerf,旨在帮助开发者和工程师摆脱直觉猜测,建立系统化、规模化的性能基准测试方法,准确衡量模型在不同负载下的响应速度与吞吐能力。

阅读原文 ↗推荐理由:介绍了大语言模型规模化推理基准测试工具 AIPerf,对模型部署与性能调优具备实用参考价值。# 大模型# 推理# 评测# 算力
9月18日2026-09-18
Ollama 更新AI 评分 45/10007:04

Ollama 发布 v0.34.2 版本,修复 MLX 推测解码内存增长问题并更新 llama.cpp

本地大模型运行框架 Ollama 发布 v0.34.2 版本更新。新版本新增了首次运行时的设置流程,用户可选择登录或直接在本地继续使用,且设置状态可在 macOS 和 Windows 桌面应用间共享;支持通过 ollama://apps 协议直接唤起桌面应用的应用页面;修复了在使用 MLX 推测解码进行长文本生成时内存过度占用的问题,并同步更新了底层 llama.cpp 依赖。

阅读原文 ↗推荐理由:本地大模型运行工具 Ollama 的常规维护更新,修复了推理长文本内存泄漏并优化了桌面端交互流程。# Ollama# 开源# 推理# 端侧AI# llama.cpp
Simon Willison✦ 精选AI 评分 75/10006:13

Bonsai 2 27B模型发布:实现近无损压缩且体积缩减至九分之一

开源社区发布了 Bonsai 2 27B 模型及其相关量化版本。该模型通过先进的压缩与量化技术,在保持接近无损性能的前提下将模型体积缩减至原来的九分之一,其 GGUF 格式模型大小仅约 5.95 GB。开发者可以通过定制的 llama.cpp 分支运行时环境在本地设备(如 macOS 等)上部署和体验该高效压缩模型。

阅读原文 ↗推荐理由:展示了大模型极端压缩(近9倍压缩)并在端侧高效推理的最新落地实践。# 模型压缩# 大模型# 开源# 推理# 端侧AI
Ollama 更新AI 评分 55/10000:45

mlxrunner 修复投机解码场景下的 KV 缓存内存泄漏缺陷

在 v0.34.2-rc2 版本中,mlxrunner 修复了投机解码过程中的内存泄漏问题。此前解码循环仅在生成 Token 数量恰好为 256 的整数倍时释放 MLX 缓冲区池;但投机解码每轮会生成多个 Token,容易直接跨过该固定边界导致释放逻辑未触发。在长上下文生成场景下,未释放的旧 KV 缓存会导致显存占用不断攀升直至 OOM。新版本修改为只要单轮跨越 256 边界即触发释放。

阅读原文 ↗推荐理由:针对投机解码在长上下文生成时的显存泄漏缺陷进行了针对性修复,提升了推理稳定性。# 推理# 大模型# 开源# 端侧AI
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

利用 PyNvVideoCodec 与 vLLM 实现多 GPU 视频字幕生成扩展

本文介绍了如何结合使用英伟达硬件视频解码库 PyNvVideoCodec 与大模型推理引擎 vLLM,在多 GPU 环境下实现视频字幕生成与视频描述任务的高效扩展。该方案通过硬件级视频解码加速数据预处理流程,有效解决了多模态视频理解任务中的数据吞吐瓶颈,提升了多卡并行推理的整体效率与性能表现。

阅读原文 ↗推荐理由:介绍了结合 PyNvVideoCodec 硬件解码与 vLLM 加速视频多模态模型多卡推理的工程实践方案。# 多模态# 推理# 英伟达# 算力# 计算机视觉
9月17日2026-09-17
vLLM 更新AI 评分 25/10018:37

开源框架发布 v0.30.0rc1 补丁:隔离 FlashInfer BF16 自动调优

本动态为开源项目的 v0.30.0rc1 预发布版本修复记录(PR #57285)。该修复主要针对 FlashInfer 库在 BF16 精度下的补充自动调优(autotuning)逻辑进行了隔离处理,旨在提升相关推理计算的稳定性和性能表现。由于原始素材仅为 Git 代码合并签名记录,未披露具体的 Bug 表现及更多技术细节。

阅读原文 ↗推荐理由:属于开源推理框架中针对 FlashInfer BF16 自动调优的具体工程修复,信息量有限。# 开源# 推理# AI编程
vLLM 更新AI 评分 30/10011:47

vLLM-proto 0.3.0 版本正式发布

开源大模型推理引擎 vLLM 的关联组件库 vllm-proto 正式发布 0.3.0 版本。由于发布页面目前仅包含版本更新标签,未提供详细的更新日志、特性列表或功能改进说明,具体变更细节有待官方进一步补充披露。该库通常用于定义 vLLM 相关的协议缓冲区与接口规范,为推理系统服务化提供基础通信支持。

阅读原文 ↗推荐理由:开源大语言模型推理框架 vLLM 相关协议组件的版本发布,但缺乏具体更新细节。# vLLM# 推理# 开源
Ollama 更新AI 评分 42/10005:06

mlxrunner 发布 v0.34.2-rc1:重构模型代码架构并整合量化逻辑

mlxrunner 推出 v0.34.2-rc1 预发布版本,重点对 model 模块进行了结构重构。新版本梳理了 runner 与模型架构协议、检查点打开以及从检查点张量构建神经网络层这三项核心职责。通过将 base.go 重命名为 model.go,并把 safetensors 头部扫描与 TensorQuantInfo 集中归入 quant.go,使得检查点量化信息的读取与解析逻辑更加聚合规范,同时规范了 nvfp4 等全局缩放辅助工具的处理。

阅读原文 ↗推荐理由:mlxrunner 推理运行框架的代码模块重构与维护版本,主要涉及量化解析和文件架构优化,技术影响力有限。# 开源# 推理# 端侧AI# 模型压缩
NVIDIA Developer Blog✦ 精选AI 评分 78/10004:37

英伟达 TensorRT Edge-LLM 在 Jetson AGX Thor 上实现 MLPerf 边缘智能体基准 6.4 倍加速

英伟达公布最新测试结果,TensorRT Edge-LLM 在 Jetson AGX Thor 平台上运行 MLPerf 边缘智能体基准测试时实现了 6.4 倍的速度提升。随着 AI 智能体逐步从云端数据中心迁移至汽车、机器人及其他边缘硬件,该技术针对需要多步骤推理的智能体工作流进行了优化,显著提升了端侧设备本地处理复杂任务的能力与能效表现。

阅读原文 ↗推荐理由:展示了英伟达下一代 Jetson Thor 平台在边缘端与具身硬件上加速运行 AI 智能体的性能突破。# 英伟达# 端侧AI# 智能体# 推理# 具身智能
9月16日2026-09-16
NVIDIA · AI 筛选✦ 精选AI 评分 80/10023:00

英伟达 Vera Rubin NVL72 在 MLPerf Inference v6.1 评测中首秀展现领先性能

英伟达下一代 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中正式亮相并取得领先成绩。测试强调了系统性能、基础设施高效扩展与持续软件优化对 AI 推理经济性的决定性影响:高系统性能可提升 Token 生成效率与商业收益,高效扩展能确保硬件吞吐量成比例增长并降低资源开销,持续优化则可最大化基础设施的投资回报价值。

阅读原文 ↗推荐理由:英伟达展示了下一代 Rubin 架构 NVL72 系统在权威 MLPerf 推理基准中的首发性能表现。# 英伟达# 算力# 芯片# 推理# 评测
vLLM 更新AI 评分 25/10016:32

vLLM 协议组件 vllm-proto 0.2.0 版本发布

开源大语言模型推理框架 vLLM 相关协议组件 vllm-proto 发布 0.2.0 版本更新。当前素材仅包含该版本通过相关 Pull Request CI 验证的基础记录,未披露具体的更新日志、新特性及性能优化等技术细节,整体信息较为有限。

阅读原文 ↗推荐理由:开源大模型推理引擎相关组件的常规版本发布记录,但缺乏详细变更细节。# 推理# 开源# 大模型
Simon Willison✦ 精选AI 评分 75/10006:47

Google推出Gemini 3.8 Live语音模型,支持实时双向语音交互

Google发布了Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款新型语音到语音(speech-to-speech)大模型,对标OpenAI的GPT-Live系列。开发者通过其WebSocket API构建了轻量级Web端体验工具,用户可在浏览器中选择模型、预设声音及系统提示词,体验支持随时打断的低延迟实时双向语音对话。

阅读原文 ↗推荐理由:Google推出新一代实时语音大模型Gemini 3.8 Live,展示了低延迟语音双向交互与打断能力。# 大模型# 语音# 多模态# Google# 推理
NVIDIA · AI 筛选✦ 精选AI 评分 78/10006:24

黄仁勋现身Dreamforce大会:Salesforce发布首款CRM推理模型Koa

在Salesforce Dreamforce大会上,英伟达创始人兼CEO黄仁勋与Salesforce CEO马克·贝尼奥夫同台亮相。会上宣布推出Salesforce首款CRM推理模型“Koa”,该模型基于英伟达Nemotron 3 Super架构构建。黄仁勋在演讲中强调AI已具备全面赋能与认知能力,展现了两家公司在企业级推理模型与智能化应用落地方面的紧密合作。

阅读原文 ↗推荐理由:Salesforce携手英伟达推出首款面向CRM场景的推理大模型Koa。# 英伟达# 大模型# 推理# 智能体
Google ResearchAI 评分 55/10004:00

绕过推理瓶颈:通过Retrieve-for-Train加速复杂AI搜索

该研究针对AI搜索过程中的推理瓶颈,提出了名为“Retrieve-for-Train”的全新方法,旨在有效加速复杂场景下的AI搜索与计算流程。文章归属于算法与理论研究方向,重点探讨如何优化复杂推理过程以降低计算延迟与资源消耗。由于目前仅披露标题与分类信息,具体的技术实现路径、模型架构细节及实验评测基准等尚有待进一步公布。

阅读原文 ↗推荐理由:聚焦AI复杂搜索与推理加速的前沿算法研究,具有一定的理论参考价值。# 推理# 大模型# 自然语言处理
Google DeepMind✦ 精选AI 评分 75/10001:05

Gemini 3.8 Live 与 3.8 Live Extended Thinking 模型正式发布

该动态宣布推出 Gemini 3.8 Live 以及具备扩展思考能力的 Gemini 3.8 Live Extended Thinking 新模型。由于输入素材仅包含标题,具体的技术架构细节、性能评测基准以及实际功能特性等详细信息尚待进一步披露。

阅读原文 ↗推荐理由:发布了具备扩展思考与实时交互能力的新一代 Gemini 系列模型。# 大模型# 推理# 多模态# Google
NVIDIA Developer Blog✦ 精选AI 评分 75/10001:00

稠密模型与MoE架构对比:激活参数、吞吐量与选型策略解析

文章深入探讨了稠密(Dense)模型与混合专家(MoE)模型的核心差异,重点解析了激活参数量、推理吞吐量以及不同应用场景下的选型策略。文中以 Nemotron 3.5 Lightning 为例,剖析了总参数量达 30B 的模型如何通过每个 Token 仅激活 3B 参数,既保持了大模型的表征能力又大幅提升了计算效率,为开发者在算力受限下权衡推理成本与模型表现提供了系统指导。

阅读原文 ↗推荐理由:系统对比了 Dense 与 MoE 架构的运行机制与吞吐性能,为大模型推理优化与架构选型提供实用参考。# 大模型# 推理# 算力# 英伟达