9月22日 2026-09-22
vLLM 更新 ✦ 精选 AI 评分 75/100 ♡ 13:20
开源大模型推理框架发布 v0.30.0 版本更新,包含来自 315 位贡献者的 762 次提交。新版本支持了多款前沿大模型及架构优化,包括支持 MXFP8 格式 KV 缓存与 FlashMLA 的 DeepSeek-V4.1-Flash、支持 ROCm 与 LoRA 的 DeepSeek-V4-Flash-Vision-Exp、支持 EPLB 的 GLM-5.3-Flash,以及 K2-Horizon、Cohere Compass、Bailing V3 VL 等,并引入了基于 AVX512/AMX 的 CPU 后端支持。
Hugging Face ✦ 精选 AI 评分 75/100 ♡ 08:00
Hugging Face 旗下核心框架 Transformers 现已支持直接加载和运行 llama.cpp 的量化格式模型。该功能进一步融合了主流开源推理生态,允许开发者在 Transformers 生态内直接使用经过 llama.cpp 极限量化的模型权重,大幅降低本地推理的显存占用并提升部署灵活性。由于输入信息较少,详细支持范围与参数请参阅官方更新说明。
Anthropic 官方动态(网页) ✦ 精选 AI 评分 75/100 ♡ 08:00
根据提供的新闻标题,Anthropic 或相关方发布了新一代旗舰大模型 Claude Opus 5.5。由于当前输入素材未提供详细摘要和正文内容,关于该模型的具体架构改进、性能评测基准、上下文窗口以及上线部署情况等细节信息暂不明确。
Simon Willison ✦ 精选 AI 评分 72/100 ♡ 07:09
TypeSafe AI 近期发布了名为 Jev 的新型模型,将其定义为“系统一模型”(System One)或“决策模型”。与传统大模型输出文本不同,Jev 虽接收非结构化文本输入,但直接返回代表分类、是非判断、评级及置信度的浮点数,实现“输入非结构化状态,输出类型化概率决策”。该模型类似前沿智能函数调用,相比传统大语言模型具有更快的响应速度和更低的成本。
NVIDIA Developer Blog ✦ 精选 AI 评分 72/100 ♡ 05:51
随着生成式AI对计算与显存的需求不断超出单卡上限,英伟达推出TensorRT多设备推理新功能,并将其集成至NVIDIA Dynamo-Triton中。该方案旨在简化跨多个GPU的大模型推理服务部署流程,有效降低多卡分布式推理的工程复杂度,提升大规模生成式AI模型在多GPU环境下的服务效率与吞吐能力。
AWS 机器学习 ✦ 精选 AI 评分 75/100 ♡ 02:30
xAI的前沿模型Grok 4.6现已正式登陆Amazon Bedrock平台。该模型专为长时间运行的智能体、编程和知识型工作设计,配备500K token的超长上下文窗口,并提供四个推理努力等级。用户可通过bedrock-mantle和bedrock-runtime端点调用,并获得Converse API及跨区域推理功能支持。
AWS 机器学习 ✦ 精选 AI 评分 68/100 ♡ 00:34
Posit 推出的下一代数据科学集成开发环境(IDE)Positron 现已支持在 Amazon SageMaker AI 上运行。在统一且受监管的 SageMaker Studio Space 环境中,数据科学家可结合 Amazon Athena 探索数据,利用 R 语言验证特征,使用 Python 训练 XGBoost 模型,直接部署 SageMaker AI 实时推理终端,并通过 Quarto 生成结果报告,实现多语言端到端工作流协同。
vLLM 官方博客(网页) ✦ 精选 AI 评分 68/100 ♡ 00:00
vLLM 官方宣布推出 vllm-metal,将 vLLM 的分页机制(PagedAttention)和连续批处理推理服务架构引入 Apple Silicon 设备。该版本旨在提升苹果芯片设备上的高并发推理能力,在面对多智能体并发负载时能提供更稳定的首字生成时间(TTFT),并支持批处理 MTP 等高级特性,优化了 Mac 设备的本地大模型部署体验。
9月19日 2026-09-19
Claude Code 更新 ✦ 精选 AI 评分 65/100 ♡ 11:10
Claude Code 迎来 v2.1.278 版本更新。本次更新将面向 Claude API、企业用户以及 AWS Bedrock、Google Vertex、Foundry 等网关的自动模式(auto mode)默认调整为服务端分类器,不再收取分类器开销费用,并支持通过环境变量配置退出;当发生计费回退时会提供警告。此外,新版本在 /status 状态面板中新增展示项,可直观查看当前会话的自动模式分类器是否在服务端运行。
Ollama 更新 AI 评分 35/100 ♡ 05:10
该发布候选版本(v0.34.3-rc0)的核心更新为通过 API 接口公开了模型的“思考级别”(thinking levels)及其默认参数设置(PR #18473)。该功能主要用于适配和精细调控具备显式思考过程的大模型推理行为。由于原始素材仅提供单行更新日志,未指明所属具体开源软件项目及更多技术细节,整体信息较为有限。
AWS 机器学习 ✦ 精选 AI 评分 75/100 ♡ 04:52
亚马逊云科技(AWS)汇总了 Amazon SageMaker AI 在 2026 年初至今推出的 13 项推理相关更新,涵盖全托管端点与 Amazon SageMaker HyperPod Inference 两大部署路径。重点功能包括推理配置推荐、容量感知实例池、分层 KV 缓存机制,以及预填充与解码解耦(disaggregated prefill and decode)等大模型推理优化技术,旨在提升云端 AI 部署效率并降低算力成本。
NVIDIA Developer Blog ✦ 精选 AI 评分 68/100 ♡ 03:04
在系统上部署大语言模型后,评估其实际推理速度与性能表现是关键难题。本文介绍了用于大规模大模型推理评测的工具 AIPerf,旨在帮助开发者和工程师摆脱直觉猜测,建立系统化、规模化的性能基准测试方法,准确衡量模型在不同负载下的响应速度与吞吐能力。
9月18日 2026-09-18
Ollama 更新 AI 评分 45/100 ♡ 07:04
本地大模型运行框架 Ollama 发布 v0.34.2 版本更新。新版本新增了首次运行时的设置流程,用户可选择登录或直接在本地继续使用,且设置状态可在 macOS 和 Windows 桌面应用间共享;支持通过 ollama://apps 协议直接唤起桌面应用的应用页面;修复了在使用 MLX 推测解码进行长文本生成时内存过度占用的问题,并同步更新了底层 llama.cpp 依赖。
Simon Willison ✦ 精选 AI 评分 75/100 ♡ 06:13
开源社区发布了 Bonsai 2 27B 模型及其相关量化版本。该模型通过先进的压缩与量化技术,在保持接近无损性能的前提下将模型体积缩减至原来的九分之一,其 GGUF 格式模型大小仅约 5.95 GB。开发者可以通过定制的 llama.cpp 分支运行时环境在本地设备(如 macOS 等)上部署和体验该高效压缩模型。
Ollama 更新 AI 评分 55/100 ♡ 00:45
在 v0.34.2-rc2 版本中,mlxrunner 修复了投机解码过程中的内存泄漏问题。此前解码循环仅在生成 Token 数量恰好为 256 的整数倍时释放 MLX 缓冲区池;但投机解码每轮会生成多个 Token,容易直接跨过该固定边界导致释放逻辑未触发。在长上下文生成场景下,未释放的旧 KV 缓存会导致显存占用不断攀升直至 OOM。新版本修改为只要单轮跨越 256 边界即触发释放。
vLLM 官方博客(网页) ✦ 精选 AI 评分 75/100 ♡ 00:00
本文介绍了如何结合使用英伟达硬件视频解码库 PyNvVideoCodec 与大模型推理引擎 vLLM,在多 GPU 环境下实现视频字幕生成与视频描述任务的高效扩展。该方案通过硬件级视频解码加速数据预处理流程,有效解决了多模态视频理解任务中的数据吞吐瓶颈,提升了多卡并行推理的整体效率与性能表现。
9月17日 2026-09-17
vLLM 更新 AI 评分 25/100 ♡ 18:37
本动态为开源项目的 v0.30.0rc1 预发布版本修复记录(PR #57285)。该修复主要针对 FlashInfer 库在 BF16 精度下的补充自动调优(autotuning)逻辑进行了隔离处理,旨在提升相关推理计算的稳定性和性能表现。由于原始素材仅为 Git 代码合并签名记录,未披露具体的 Bug 表现及更多技术细节。
vLLM 更新 AI 评分 30/100 ♡ 11:47
开源大模型推理引擎 vLLM 的关联组件库 vllm-proto 正式发布 0.3.0 版本。由于发布页面目前仅包含版本更新标签,未提供详细的更新日志、特性列表或功能改进说明,具体变更细节有待官方进一步补充披露。该库通常用于定义 vLLM 相关的协议缓冲区与接口规范,为推理系统服务化提供基础通信支持。
Ollama 更新 AI 评分 42/100 ♡ 05:06
mlxrunner 推出 v0.34.2-rc1 预发布版本,重点对 model 模块进行了结构重构。新版本梳理了 runner 与模型架构协议、检查点打开以及从检查点张量构建神经网络层这三项核心职责。通过将 base.go 重命名为 model.go,并把 safetensors 头部扫描与 TensorQuantInfo 集中归入 quant.go,使得检查点量化信息的读取与解析逻辑更加聚合规范,同时规范了 nvfp4 等全局缩放辅助工具的处理。
NVIDIA Developer Blog ✦ 精选 AI 评分 78/100 ♡ 04:37
英伟达公布最新测试结果,TensorRT Edge-LLM 在 Jetson AGX Thor 平台上运行 MLPerf 边缘智能体基准测试时实现了 6.4 倍的速度提升。随着 AI 智能体逐步从云端数据中心迁移至汽车、机器人及其他边缘硬件,该技术针对需要多步骤推理的智能体工作流进行了优化,显著提升了端侧设备本地处理复杂任务的能力与能效表现。
9月16日 2026-09-16
NVIDIA · AI 筛选 ✦ 精选 AI 评分 80/100 ♡ 23:00
英伟达下一代 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中正式亮相并取得领先成绩。测试强调了系统性能、基础设施高效扩展与持续软件优化对 AI 推理经济性的决定性影响:高系统性能可提升 Token 生成效率与商业收益,高效扩展能确保硬件吞吐量成比例增长并降低资源开销,持续优化则可最大化基础设施的投资回报价值。
vLLM 更新 AI 评分 25/100 ♡ 16:32
开源大语言模型推理框架 vLLM 相关协议组件 vllm-proto 发布 0.2.0 版本更新。当前素材仅包含该版本通过相关 Pull Request CI 验证的基础记录,未披露具体的更新日志、新特性及性能优化等技术细节,整体信息较为有限。
Simon Willison ✦ 精选 AI 评分 75/100 ♡ 06:47
Google发布了Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款新型语音到语音(speech-to-speech)大模型,对标OpenAI的GPT-Live系列。开发者通过其WebSocket API构建了轻量级Web端体验工具,用户可在浏览器中选择模型、预设声音及系统提示词,体验支持随时打断的低延迟实时双向语音对话。
NVIDIA · AI 筛选 ✦ 精选 AI 评分 78/100 ♡ 06:24
在Salesforce Dreamforce大会上,英伟达创始人兼CEO黄仁勋与Salesforce CEO马克·贝尼奥夫同台亮相。会上宣布推出Salesforce首款CRM推理模型“Koa”,该模型基于英伟达Nemotron 3 Super架构构建。黄仁勋在演讲中强调AI已具备全面赋能与认知能力,展现了两家公司在企业级推理模型与智能化应用落地方面的紧密合作。
Google Research AI 评分 55/100 ♡ 04:00
该研究针对AI搜索过程中的推理瓶颈,提出了名为“Retrieve-for-Train”的全新方法,旨在有效加速复杂场景下的AI搜索与计算流程。文章归属于算法与理论研究方向,重点探讨如何优化复杂推理过程以降低计算延迟与资源消耗。由于目前仅披露标题与分类信息,具体的技术实现路径、模型架构细节及实验评测基准等尚有待进一步公布。
Google DeepMind ✦ 精选 AI 评分 75/100 ♡ 01:05
该动态宣布推出 Gemini 3.8 Live 以及具备扩展思考能力的 Gemini 3.8 Live Extended Thinking 新模型。由于输入素材仅包含标题,具体的技术架构细节、性能评测基准以及实际功能特性等详细信息尚待进一步披露。
NVIDIA Developer Blog ✦ 精选 AI 评分 75/100 ♡ 01:00
文章深入探讨了稠密(Dense)模型与混合专家(MoE)模型的核心差异,重点解析了激活参数量、推理吞吐量以及不同应用场景下的选型策略。文中以 Nemotron 3.5 Lightning 为例,剖析了总参数量达 30B 的模型如何通过每个 Token 仅激活 3B 参数,既保持了大模型的表征能力又大幅提升了计算效率,为开发者在算力受限下权衡推理成本与模型表现提供了系统指导。