Diffusers 原生支持 Nunchaku 4-bit 扩散模型量化推理
Hugging Face Diffusers 正式集成基于 SVDQuant 的 Nunchaku 4-bit(W4A4/AWQ)量化推理,支持直接通过 from_pretrained() 加载量化模型。
推荐理由:原文给出了 W4A4 量化在 Diffusers 框架下的显存与延迟实测数据,读者可以据此评估扩散模型在消费级显卡上的量化部署收益。
Hugging Face Diffusers 正式集成基于 SVDQuant 的 Nunchaku 4-bit(W4A4/AWQ)量化推理,支持直接通过 from_pretrained() 加载量化模型。
推荐理由:原文给出了 W4A4 量化在 Diffusers 框架下的显存与延迟实测数据,读者可以据此评估扩散模型在消费级显卡上的量化部署收益。
Vertiv 宣布为美国海军研究生院(NPS)部署集成式供配电、液冷、机柜及安装服务,以支持其全新的 NVIDIA DGX GB300 系统。Vertiv 为该项目设计并交付了三机柜 Vertiv SmartIT 集成 AI 基础设施,涵盖电力保护与分配、液冷技术及流体管理等。该部署展示了如何在现有设施中改造落地高密度液冷环境,用于教育、研究与数字工程。
Google Research 发布基于 Gemini Flash 2.0 的对话式症状评估智能体研究 SymptomAI,在包含 13,917 名参与者的全美规模真实测试中验证了端到端问诊与鉴别诊断能力。
推荐理由:该研究展示了对话式智能体在万人级真实问诊与鉴别诊断中的准确性,为结合可穿戴设备的日常健康评估提供了可行路径。
Google Quantum AI 与 Google DeepMind 在《Nature》发表论文,提出一种基于强化学习的自主控制框架,使量子计算机能够在执行计算的同时利用量子纠错检测信号实时调节数千个控制参数。
推荐理由:该研究展示了利用强化学习根据纠错检测信号动态调整控制参数的方法,解决了量子计算机运行期间因硬件漂移必须中断计算进行重新校准的瓶颈。
Google 宣布向美国能源部(DOE)Genesis Mission 承诺投入 $40M 的 AI tokens 与云额度,以加速前沿科学发现。
推荐理由:该计划明确了前沿 AI 工具与云资源在国家级科研实验中的落地清单及实际应用路径。
Google DeepMind 正式推出 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber。
推荐理由:Google DeepMind 推出三款轻量模型,在降低调用成本与输出 token 消耗的同时强化了智能体工作流与代码安全能力。
Vertiv 宣布投资扩建位于意大利帕多瓦附近的 Tognana 园区,以提升数据中心冷却系统的制造和集成测试能力。该投资预计到 2026 年底将该地区的冷水机组产能翻倍,并计划于 2027 年初建成新的大型测试实验室。新实验室将在高密度负载与极端温度条件下测试大型冷水机组,并验证其与液冷系统的集成性能。
推荐理由:原文披露了冷水机组产能翻倍与液冷验证实验室规划,读者可据此了解高密度智算散热基建的制造供应节奏。
Hugging Face 联合 Pollen Robotics 开源了低成本机器人操作数据采集系统 Grabette,无需真机遥操作即可通过手持夹爪录制示教数据并自动转换为训练格式。
推荐理由:项目开源了低成本手持示教硬件与自动化处理流,为具身智能数据采集提供了摆脱昂贵遥操作机械臂的可复现方案。
通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。
推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。
阶跃星辰在 WAIC 2026 展区集中展示了获得“镇馆之宝”荣誉的智能体手机 STEPX Neo、Step 系列模型矩阵、汽车智能体及多机器人具身智能项目。STEPX Neo 搭载 Step AOS 系统与 Amoo 智能体,是目前唯一获得相关国标 L3 级检测报告的智能体手机,底层由 Step Edge 与 Step 3.7 Flash 等模型驱动。
阶跃星辰与上海期智研究院达成合作,共同设立智能体前沿研究院,围绕智能体网络及经济原理、AI Safety 等方向开展联合研究。双方联合提出涵盖行动权利、责任秩序、安全范式、经济基础和人机共生的“智能体时代五大全球新命题”。此外,阶跃星辰同步推出 StepStar 顶尖人才计划,在全球范围内招募智能体领域人才。
Google DeepMind 推出轻量网络安全模型 Gemini 3.5 Flash Cyber,基于 Gemini 3.5 Flash 微调,专用于快速发现、验证和修复软件漏洞。
推荐理由:原文展示了用轻量低成本模型驱动安全智能体多轮探索代码路径的工程思路,为高频漏洞扫描与修复提供了实用参考。
阶跃星辰董事长印奇在 WAIC 2026 上指出,AI 下一波爆发点是智能体模型与下一代终端产品的结合。他认为智能体将带来新系统(Agentic OS)、新载体与 A2A 网络三大结构性变化,并提出“智能体能力 = 模型能力 × 智能体操作系统能力”公式。目前阶跃星辰正与上海期智研究院合作探索智能体时代的治理机制。
通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。
推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。
DharmaOCR 在巴西葡萄牙语基准测试中取得 0.925 分,显著领先更新的 Mistral OCR4(0.798 分)和 Unlimited-OCR(0.7587 分)。该模型通过监督微调将全部参数容量集中于目标语言结构,并引入直接偏好优化(DPO)抑制重复与不连贯输出。测试结果表明,垂直领域专精训练在复杂文档抽取质量和推理稳定性上明显优于多语言通用模型。
Transformers 发布 v5.14.1 补丁版本,主要修复了集成 Inkling 模型时影响 EncoderDecoderCache 辅助生成的问题。该版本还修复了带 position_bias 的 Inkling 在 StaticCache 及 sdpa 预填充时的异常,以及 OlmoHybrid 的辅助解码问题。
Google DeepMind 与 Isomorphic Labs 联合公布了生物韧性方案,旨在防范 AI 模型被恶意利用并加速应对全球生物威胁。该方案围绕预防、检测和响应三大方向展开,包括将 SynthID 水印技术应用于生物序列筛选、利用 AlphaEvolve 与 AlphaGenome 优化病原体监测,以及通过 IsoDDE 药物设计引擎加速疫苗与对策研发。
Hugging Face 披露其生产基础设施遭遇到由自主 AI 智能体系统驱动的入侵攻击,导致部分内部数据集及多组凭据发生未授权访问。攻击者利用数据集处理流程中的远程代码加载及模板注入漏洞获取初始权限并横向移动,公开模型、数据集和软件供应链未受篡改。官方已修复漏洞、轮换凭据并重建节点,并在调查中利用自建部署的开源模型分析了超 1.7 万条攻击日志,同时建议用户轮换访问 Token。
推荐理由:官方披露了由自主智能体发动的多阶段入侵实况,为防御方提供了本地部署模型应对安全分析与护栏限制的可迁移经验。
Hugging Face 发布 Transformers v5.14.0 版本,正式新增对 Thinking Machines 开源多模态模型 Inkling(总参数 975B、激活参数 41B)及 TIPSv2 的支持。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中的得分平滑(score smoothing)效应。权重衰减等正则化机制使神经网络学到更平缓的得分函数,促使去噪过程在训练样本之间的“插值区”停驻并生成全新样本。该机制解释了扩散模型如何摆脱单纯的样本记忆,实现对复杂数据流形的有效恢复。
IBM Research 发文指出智能体系统中的模型路由并非单纯的模型分类选择,而是需要综合平衡成本、质量与延迟的系统优化问题。实测显示由于上下文缓存大幅降低输入成本,名义单价更高的 Claude Sonnet 4.6 在 AppWorld 测试中总成本为 $79,显著低于 GPT-4.1 的 $155。
推荐理由:原文通过具体测试数据揭示了缓存机制与系统开销对模型实际成本的影响,为智能体路由设计提供了可参考的系统优化视角。
阶跃星辰公布 WAIC 2026 参展亮点,将集中展示覆盖云端与端侧的 Step 系列模型矩阵,以及智能体原生操作系统 Step AOS。获评 WAIC“镇馆之宝”的智能体手机 STEPX Neo 将首次线下公开亮相,汽车智能体也已搭载于极氪8X。此外,现场还将携手原力灵机发起 6 台机器人连续协作 15 小时拼装 8 万余块积木长城的极限挑战。
通义实验室将语音交互模型 Fun-Realtime-AudioChat 正式升级更名为 Qwen-Audio-3.0-Realtime 并上线阿里云百炼,提供 plus 和 flash 两个版本。
推荐理由:升级通过多模态双工与多教师蒸馏兼顾了低延迟抗噪和复杂工具调用,适合语音交互开发者参考。
Thinking Machines Lab 推出原生全模态开源模型 Inkling 及轻量版 Inkling-Small,现已上线 Hugging Face 并提供首日生态支持。
推荐理由:该模型采用 MoE 与原生多模态统一输入架构,为大参数量跨模态推理与量化部署提供了完整的开源落地参考。
Hugging Face 推出 Real World VoiceEQ 评测基准,旨在衡量语音 AI 在真实复杂对话中的拟人交互质量。该基准基于超过 100 万次人类评分,包含 78.5 万条 TTS 和 4.8 万条 STS 评分,涵盖 15 个以上评估维度与 60 多项指标,对 40 多个主流开源及专有模型展开了评测。
推荐理由:该基准基于超百万次人类评分评估语音交互的拟人表现,揭示了传统指标高估现实能力的短板,为检验语音感知提供了新参考。
Google 联合 Cypress Creek Energy 在美国阿肯色州密西西比县动工建设 Steel River 能源中心,为数据中心等设施供应全天候无碳电力。
推荐理由:Google 披露了其最大光储项目的分期规划与装机参数,展示了科技巨头通过超大规模储能配套实现数据中心全天候清洁供电的落地路径。
Kubernetes SIG UI 推出面向 Kubeflow 的 Headlamp 插件,将 Notebooks、Pipelines、Katib、Training 及 Spark 等机器学习自定义资源(CRD)直接接入通用 Kubernetes UI。
Google DeepMind 联合印度 Atal 创新使命推出基于 Gemini 3.5 Flash 的 Web 应用 ATL Saathi 试点,为印度创新实验室教师提供全天候教学规划与培训助手。该工具基于 NotebookLM 组织 12 个核心模块课程并生成微学习内容,支持 8 种语言交互,且能针对实验项目生成分步装配指南与接线图。目前该项目正面向首批 100 所学校展开试点。
阶跃星辰发布面向手机与汽车等终端场景的 Step Edge 端侧模型家族,涵盖基础模型、Audio、GUI 及 Gen 四类模型。该系列支持低至 0.1 秒的本地 toolcall 执行与全模态隐私保护,并在 29 项核心评测指标中取得领先;官方同时推出了配套的 Step Inference NPU 自研推理引擎以优化终端延迟。
推荐理由:阶跃星辰面向手机和汽车等场景推出端侧模型家族并配套自研推理引擎,展示了端云协同与本地执行的技术路径。
Transformers 发布 v5.13.1 补丁版本,主要重点在于支持最新版本的 vLLM。该版本增强了自定义模型在 remap_legacy_layer_types 下的防御性处理,并修复了自定义代码无法识别新线性层类型名称的问题。此外,更新还修复了向 _LazyAutoMapping.register 传入 str 键时的处理异常。
Hugging Face 发布 PyTorch 性能分析系列第三篇,对比分析了手写原生注意力机制、In-place 掩码以及 SDPA 旗下四种后端(math、efficient、flash、cuDNN)在 GPU 上的算子特征与执行开销。
推荐理由:文章拆解了 PyTorch 中不同 Attention 后端的底层算子行为与显存交互,展示了如何通过性能分析轨迹定位非预期开销。
Google Research 推出面向可穿戴健康数据的大型传感器基础模型 SensorFM,基于 500 万受试者超过 1 万亿分钟的多模态无标注传感器数据进行自监督预训练。
推荐理由:原文展示了利用海量无标注传感器数据预训练基础模型的方法,读者可据此参考时序健康信号的通用表征构建方式。
阶跃星辰发布预告,宣布将在 Agent 时代推出新一代智能体终端产品。官方将其称为“新的伙伴、新的物种”,并关联提及“阶跃终端”,具体产品形态与发布细节尚未正式披露。
Hugging Face 升级了 vLLM 的 transformers 建模后端,使其在多类大语言模型架构上的推理吞吐量追平甚至超越 vLLM 手写原生实现。
推荐理由:关注大模型推理部署的开发者可以了解该后端如何免去为推理框架单独手写优化实现的繁琐流程。
Hugging Face 宣布与 Amazon SageMaker AI 推出深度链接集成,开发者可在模型页面一键跳转至 SageMaker Studio 进行模型微调或推理部署。
Google Research 在《Nature Cities》发表研究,展示了利用导航平台进行全网协同干预以缓解城市交通拥堵的大规模真实实验结果。研究在全美 10 个主要城市调整 Google Maps 算法进行了为期 6 个月的对照实验,仅对不到 2% 的行程引导至耗时相近的替代路线,便使目标拥堵路段中位车速提升约 2%、油耗降低 0.5% 至 1.0%。
Hugging Face 与微软合作在 Microsoft Foundry 中推出 Hugging Face Collection,支持在托管 GPU 平台 Foundry Managed Compute 上一键部署开源权重模型。
推荐理由:原文给出了预置权重、多引擎托管与统一安全治理的落地架构,读者可以据此评估企业私有化部署开源模型与智能体集成的工程链路。
Hugging Face 发布开源机器人学习库 LeRobot v0.6.0,引入世界模型策略、统一奖励模型 API 与人机回环部署 CLI,全面构建机器人学习闭环。
推荐理由:新版本通过集成世界模型、奖励模型评估与人机协同干预工具链,为具身智能策略的闭环训练与快速部署提供了可复用的标准化工程流程。
SkyPilot 与 Hugging Face 联合支持将 Hugging Face Storage 作为一级存储后端,允许通过统一的 hf:// 路径将 Hub 仓库或 Buckets 挂载至跨 20 多个云厂商、Kubernetes 及本地集群的计算任务中。
推荐理由:原文解析了跨云调度 AI 任务时消除出站流量成本的集成方案,读者可据此优化多云算力下的模型挂载与数据同步链路。
Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。
推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。