AIDC
DC AI 热点

全部 AI 动态

9月23日2026-09-23
Ollama 更新✦ 精选AI 评分 60/10004:42

Ollama 发布 v0.34.3 版本更新,支持模型思考控制查询与 Nemotron 视觉模型

本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。

阅读原文 ↗推荐理由:开源大模型本地部署与推理工具 Ollama 的功能更新,增强了思考参数控制及多模态模型支持。# Ollama# 开源# 推理# 端侧AI# 多模态
9月22日2026-09-22
AWS 机器学习✦ 精选AI 评分 68/10023:19

Tata Elxsi 基于 AWS 构建工业安全平台 IRIS,实现秒级风险检测

Tata Elxsi 基于 AWS 构建了实时工业安全平台 IRIS。该平台通过在边缘端对摄像头视频进行过滤,利用 Amazon Kinesis 传输元数据,并在 Amazon SageMaker AI 上运行计算机视觉模型,将检测结果关联为高置信度警报。该系统将不安全工况的检测时间从数分钟缩短至数秒,显著提升了工业现场的安全响应效率。

阅读原文 ↗推荐理由:展示了结合边缘计算、云计算与计算机视觉的工业安全落地应用工程方案。# 计算机视觉# 端侧AI# 推理# AWS
NVIDIA Developer Blog✦ 精选AI 评分 75/10021:00

英伟达发布DLSS 5:引入3D引导神经渲染,升级ACE与RTX套件功能

英伟达面向游戏开发者发布系列技术更新,推出DLSS 5并引入DLSS 3D引导神经渲染(3D-Guided Neural Rendering)及精细化控制功能,旨在帮助开发者在保持渲染性能的同时,呈现逼真的光照效果和材质细节。此外,本次更新还涵盖了NVIDIA ACE(虚拟数字人技术)的最新进展以及RTX Kit套件的新功能增强。

阅读原文 ↗推荐理由:英伟达发布全新DLSS 5技术及图形渲染重大更新,对游戏开发与图形渲染生态具有重要影响。# 英伟达# 计算机视觉# 端侧AI# 芯片
Hugging FaceAI 评分 55/10008:00

oMLX 创建者 Jun Kim 加入 Hugging Face,将重点支持 MLX 社区生态

开源项目 oMLX 的创建者兼维护者 Jun Kim 宣布加入 Hugging Face,未来将专注于支持与发展苹果芯片机器学习框架 MLX 的开源生态。MLX 是苹果专为 Apple Silicon 设计的深度学习框架,oMLX 则为其相关衍生工具。由于原文仅提供标题信息,其具体职责及合作路线图等细节尚未披露。

阅读原文 ↗推荐理由:知名苹果端侧框架生态开发者加盟 Hugging Face,或进一步推动端侧 AI 及 Mac 算力生态整合。# Hugging Face# 开源# 端侧AI# 大模型
vLLM 官方博客(网页)✦ 精选AI 评分 68/10000:00

vllm-metal 发布:为苹果芯片带来高并发大模型推理服务支持

vLLM 官方宣布推出 vllm-metal,将 vLLM 的分页机制(PagedAttention)和连续批处理推理服务架构引入 Apple Silicon 设备。该版本旨在提升苹果芯片设备上的高并发推理能力,在面对多智能体并发负载时能提供更稳定的首字生成时间(TTFT),并支持批处理 MTP 等高级特性,优化了 Mac 设备的本地大模型部署体验。

阅读原文 ↗推荐理由:知名大模型推理框架 vLLM 拓展至苹果芯片生态,提升了本地及端侧并发推理效率。# 推理# 端侧AI# 开源# 智能体# 芯片
9月18日2026-09-18
Ollama 更新AI 评分 45/10007:04

Ollama 发布 v0.34.2 版本,修复 MLX 推测解码内存增长问题并更新 llama.cpp

本地大模型运行框架 Ollama 发布 v0.34.2 版本更新。新版本新增了首次运行时的设置流程,用户可选择登录或直接在本地继续使用,且设置状态可在 macOS 和 Windows 桌面应用间共享;支持通过 ollama://apps 协议直接唤起桌面应用的应用页面;修复了在使用 MLX 推测解码进行长文本生成时内存过度占用的问题,并同步更新了底层 llama.cpp 依赖。

阅读原文 ↗推荐理由:本地大模型运行工具 Ollama 的常规维护更新,修复了推理长文本内存泄漏并优化了桌面端交互流程。# Ollama# 开源# 推理# 端侧AI# llama.cpp
Simon Willison✦ 精选AI 评分 75/10006:13

Bonsai 2 27B模型发布:实现近无损压缩且体积缩减至九分之一

开源社区发布了 Bonsai 2 27B 模型及其相关量化版本。该模型通过先进的压缩与量化技术,在保持接近无损性能的前提下将模型体积缩减至原来的九分之一,其 GGUF 格式模型大小仅约 5.95 GB。开发者可以通过定制的 llama.cpp 分支运行时环境在本地设备(如 macOS 等)上部署和体验该高效压缩模型。

阅读原文 ↗推荐理由:展示了大模型极端压缩(近9倍压缩)并在端侧高效推理的最新落地实践。# 模型压缩# 大模型# 开源# 推理# 端侧AI
Ollama 更新AI 评分 55/10000:45

mlxrunner 修复投机解码场景下的 KV 缓存内存泄漏缺陷

在 v0.34.2-rc2 版本中,mlxrunner 修复了投机解码过程中的内存泄漏问题。此前解码循环仅在生成 Token 数量恰好为 256 的整数倍时释放 MLX 缓冲区池;但投机解码每轮会生成多个 Token,容易直接跨过该固定边界导致释放逻辑未触发。在长上下文生成场景下,未释放的旧 KV 缓存会导致显存占用不断攀升直至 OOM。新版本修改为只要单轮跨越 256 边界即触发释放。

阅读原文 ↗推荐理由:针对投机解码在长上下文生成时的显存泄漏缺陷进行了针对性修复,提升了推理稳定性。# 推理# 大模型# 开源# 端侧AI
9月17日2026-09-17
Ollama 更新AI 评分 42/10005:06

mlxrunner 发布 v0.34.2-rc1:重构模型代码架构并整合量化逻辑

mlxrunner 推出 v0.34.2-rc1 预发布版本,重点对 model 模块进行了结构重构。新版本梳理了 runner 与模型架构协议、检查点打开以及从检查点张量构建神经网络层这三项核心职责。通过将 base.go 重命名为 model.go,并把 safetensors 头部扫描与 TensorQuantInfo 集中归入 quant.go,使得检查点量化信息的读取与解析逻辑更加聚合规范,同时规范了 nvfp4 等全局缩放辅助工具的处理。

阅读原文 ↗推荐理由:mlxrunner 推理运行框架的代码模块重构与维护版本,主要涉及量化解析和文件架构优化,技术影响力有限。# 开源# 推理# 端侧AI# 模型压缩
NVIDIA Developer Blog✦ 精选AI 评分 78/10004:37

英伟达 TensorRT Edge-LLM 在 Jetson AGX Thor 上实现 MLPerf 边缘智能体基准 6.4 倍加速

英伟达公布最新测试结果,TensorRT Edge-LLM 在 Jetson AGX Thor 平台上运行 MLPerf 边缘智能体基准测试时实现了 6.4 倍的速度提升。随着 AI 智能体逐步从云端数据中心迁移至汽车、机器人及其他边缘硬件,该技术针对需要多步骤推理的智能体工作流进行了优化,显著提升了端侧设备本地处理复杂任务的能力与能效表现。

阅读原文 ↗推荐理由:展示了英伟达下一代 Jetson Thor 平台在边缘端与具身硬件上加速运行 AI 智能体的性能突破。# 英伟达# 端侧AI# 智能体# 推理# 具身智能