通义实验室发布 Fun-ASR-Realtime 实时语音识别模型
通义实验室发布 Fun-ASR-Realtime 语音识别模型,单模型支持 30 种语言与 16 种方言,并在工业级方言测评中取得 87.8% 的语义准确率。该模型采用流式与非流式一体化训练,首字延迟控制在百毫秒级,支持动态注入热词与对话上下文以实现同音词和领域词消歧,相关 API 已上线阿里云百炼平台。
通义实验室发布 Fun-ASR-Realtime 语音识别模型,单模型支持 30 种语言与 16 种方言,并在工业级方言测评中取得 87.8% 的语义准确率。该模型采用流式与非流式一体化训练,首字延迟控制在百毫秒级,支持动态注入热词与对话上下文以实现同音词和领域词消歧,相关 API 已上线阿里云百炼平台。
Hugging Face 宣布对 🤗 Kernels 项目进行全面重构与更新,在 Hub 上正式推出了全新的 kernel 仓库类型。新版本引入了受信任发布者机制与基于 Sigstore cosign 的临时私钥代码签名,并将加载工具 kernels 与构建工具 kernel-builder 的 CLI 彻底解耦。
推荐理由:通过统一内核仓库类型并结合代码签名与受信任发布机制,为底层算力优化与智能体生成内核提供了标准化的安全分发底座。
Google DeepMind 宣布与独立电影制片发行公司 A24 达成长期研发合作,Google 同时已对 A24 完成投资。双方将把 DeepMind 的前沿技术研究直接融入影视创作者的实际工作流,借助一线艺术家的反馈共同探索和塑造下一代影视创作工具与叙事形式。
推荐理由:该合作将前沿 AI 技术直接接入专业影视制作流程,为观察生成式工具在电影工业中的研发与落地提供了样本。
Vertiv 宣布在马来西亚柔佛启用全新制造基地,扩充在亚洲的制造布局,以支持东南亚、北亚、澳大利亚和新西兰地区对 AI 及高密度算力基础设施的需求。该工厂提供先进热管理与电力基础设施的端到端制造、组装与全尺寸见证测试,预计于 2027 年全面投入运营并提供数百个技术岗位。
Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。
推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。
IBM Research 推出开源评测基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE 和 Quarkus 之间跨框架迁移企业级 Java 应用的能力。
Google Research 扩展了建筑级屋顶反射率数据集并面向全球 50+ 个城市开放,通过新上线的 Heat Resilience Earth Engine App 提供访问与下载。该方案结合 Sentinel-2 与 30-cm 分辨率卫星影像及机器学习模型,反照率地图 RMSE 达到 0.04,旨在辅助城市规划凉爽屋顶以缓解最高 0.5°C 的极端高温。
Google DeepMind 宣布面向开发者推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash。
推荐理由:文章给出了两款模型的具体定价与核心延迟指标,方便开发者评估多模态生成管线的吞吐与成本。
Dharma AI 结合 Yann LeCun 等人 2026 年的研究论文,阐明 AI 走向领域专业化而非盲目追求通用的理论依据与现实必然性。文章从优化理论(没有免费午餐定理)、进化生物学、市场竞争选择以及机器学习实践(如负迁移、MoE 架构和 AlphaFold)四个维度论证,在资源有限的约束下,针对特定任务的资源集中与匹配度始终优于宽泛覆盖。
Google Research 推出针对表格数据的零样本基础模型 TabFM,将表格预测重构为上下文学习任务,无需手动训练、特征工程与超参数微调即可在单次前向传递中完成分类与回归。
推荐理由:通过将表格预测重塑为上下文学习任务并结合因果合成数据预训练,为结构化数据分类与回归提供了无需调参的零样本推理方案。
Hugging Face 与 EvalEval 联盟的 Every Eval Ever(EEE)达成互通,支持将标准化的 AI 评测记录直接同步至 Hugging Face 模型页面与对应的数据集排行榜。
推荐理由:打通标准化评测数据与模型展示页面,有助于降低跨平台维护评测记录的成本,并让基准得分直接溯源至完整运行配置。
研究人员提出 DiScoFormer(Density and Score Transformer),通过单次前向传播即可同时估计任意数据集的概率密度与分数(Score),无需针对新分布重新训练。模型采用共享 Transformer 主干与双输出头设计,在推理时可通过无标签一致性损失自适应分布外数据。在 100 维测试中,其相比调优后的 KDE 将分数误差降低约 6.5x,密度误差降低超过 37x。
Google Research 提出一种在冻结权重基础上集成多 Token 预测(MTP)头的端侧推理加速架构,已部署于 Pixel 9 与 10 系列设备。
推荐理由:阐述了在不重训基座模型的前提下通过跨注意力复用缓存实现端侧投机解码,为移动设备内存与能耗受限场景提供了可落地的加速方案。
Kubernetes 社区发布针对 AI 辅助贡献的治理规范,要求贡献者必须透明披露 AI 使用情况并承担全部代码责任,严禁将 AI 列为共同作者,若无法亲自解释 AI 生成的代码将被直接关闭 PR。
推荐理由:Kubernetes 针对 AI 辅助贡献明确了透明披露与人类问责机制,为大型开源社区应对 AI 代码冲击提供了可参考的治理范式。
AWS 介绍了利用 AI 智能体与 AWS Parallel Computing Service(AWS PCS)重塑高性能计算(HPC)工作负载编排的架构设计与实现方法。
Headlamp 通过新增的 Volcano 插件,支持在其 Web UI 中统一查看与排查 Volcano 的核心资源、队列行为及组调度(gang scheduling)详情。
Google Research 提出线性弹性缓存(linear elastic caching)机制,将页面逐出建模为“滑雪租赁”问题,利用轻量决策树动态预测页面 TTL 并调整缓存规模。在 Spanner 生产环境中实测显示,该方案使内存使用量降低 15.5%,总拥有成本(TCO)减少约 5%,且实际 I/O 成本影响仅为 0.5%。
Kubernetes 官方博客专访设备管理工作组三位联合主席,详解动态资源分配(DRA)毕业至 GA 后的架构演进与 AI 硬件调度实践。DRA 通过 ResourceSlice 与 ResourceClaim 声明式 API 替代了传统设备插件的粗粒度整数分配,支持 GPU 拓扑感知、MIG 切分及平台介导的动态容量共享。
推荐理由:工作组核心成员深入剖析了 DRA 如何替代传统设备插件,为 AI 负载提供细粒度拓扑感知与动态共享调度能力。
Google Research 发文揭示了大语言模型通过推理链(CoT)召回单跳事实类参数化知识的核心机制。在 Gemini-2.5 和 Qwen3-32B 等模型上的实验表明,即使面对无须逻辑拆解的简单事实问答,开启推理也能显著提升召回率,其动力来自额外 token 提供的计算缓冲效应以及生成相关背景事实的事实启动效应。
推荐理由:研究解构了思考过程辅助大模型召回参数化知识的机制,为理解推理模型的能力边界与中间步骤优化提供了实验依据。
Google DeepMind 宣布在 Gemini 3.5 Flash 中原生内置 Computer Use 工具,此前该能力仅作为独立的 Gemini 2.5 专用模型提供。
推荐理由:官方将跨平台操作能力整合为主线轻量模型的内置工具,为低成本构建自动化交互智能体提供了实用参考。
通义实验室正式开源原生语言世界模型 Qwen-AgentWorld 及其评测基准 AgentWorldBench。该模型基于超 1000 万条真实交互轨迹,经由继续预训练、监督微调和强化学习三阶段训练,覆盖 MCP、Search、Terminal、SWE 等文本类及 Web、OS、Android 等 GUI 类共七大领域。
推荐理由:模型通过对环境交互显式建模来降低沙箱试错成本,为智能体强化学习和跨任务泛化提供了可控模拟路径。
通义实验室联合中国人民大学高瓴人工智能学院开源统一科学大模型 LOGOS,将蛋白质、小分子和材料等异构科学对象编码为统一离散序列。模型基于 7 类模态共 44.87B tokens 语料预训练,无需显式 3D 坐标即可建模空间互作规律,并在配体生成、逆合成预测等六大任务上匹敌或超越领域专用方法。
推荐理由:该模型通过离散化序列将多领域科学对象统一纳入自回归框架,展示了摆脱显式三维几何网络并复用成熟语言模型工程栈的可行路径。
智谱正式上线并开源 GLM-5.2 模型,遵循 MIT 协议,主打 1M 上下文与长程编程任务能力。在 FrontierSWE 等基准测试中其表现逼近 Claude Opus 4.8,并通过 IndexShare 架构优化将 1M 上下文下的单位 token FLOPs 降低至 2.9 倍。
推荐理由:模型主打长程编程任务与长上下文支持,结合架构优化降低推理算力消耗,为长链路软件工程落地提供了开源参考。
Google DeepMind 与英国政府、Google Cloud 及 Faculty 等合作开发了基于 Gemini 的 AI 规划审批工具原型,旨在将房主规划申请的审批决策时间缩短 50%。
Google 发布英格兰精细生态要素的矢量化数据集,利用基于超 3 亿张卫星图像预训练的 Vision-Transformer(ViT)模型识别传统卫星难以检测的树篱、石墙和小树林。该方案结合亚米级图像与 1 米 LiDAR 数据,覆盖英格兰逾 13 万平方公里区域,解决了要素重叠与跨图块拼接等计算难题。
Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与智能体安全技术框架,提出将潜在失齐的 AI 智能体视为内部威胁的系统级纵深防御体系。
推荐理由:文章提出了将潜在失齐智能体视为内部威胁的系统级防御框架,为自主系统的实时监督与分级拦截提供了落地参考。
通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。
推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。
Transformers 发布补丁版本 v5.12.1,更新了 PEFT 的版本下限,并修复了安装 mistral-common 时 auto tokenizer 正确解析 Mistral 分词器的问题。该版本变动类似于 v5.10.3 并剔除了主版本中已包含的修复,此外 vLLM 将首先针对 5.10.3 进行适配。
Google 宣布在 2026 和 2027 年投资 15 亿美元,扩建位于美国阿拉巴马州杰克逊县的数据中心园区。该园区自 2019 年在废弃燃煤电厂旧址上改造运营,Google 将 100% 全额自费承担所有电力与基础设施成本。同时 Google 设立了 200 万美元能源影响基金并捐助 55 万美元 STEM 教育物资,以支持当地社区。
推荐理由:Google 全额承担用电与配套基建成本扩建旧燃煤电厂园区,为大型企业应对电网负荷审查提供了基建扩容参考。
Kubernetes SIG Storage 联合主席 Xing Yang 介绍了该小组的演进历程及最新存储功能进展。VolumeGroupSnapshot 在 Kubernetes v1.36 达到 GA,支持多卷崩溃一致性快照;CSI CBT 亦在 v1.36 升至 Beta 以实现高效增量备份。
智谱宣布 GLM-5.2 全量开放,该模型支持 1M 上下文并主打长程任务与代码能力。GLM-5.2 将面向 GLM Coding Plan 全量用户(Lite / Pro / Max / 团队版)开放,其 API 将于下周上线,模型也将于下周遵循 MIT 协议正式开源。
推荐理由:原文给出了上线节奏、版本开放范围和开源协议,开发者可以据此了解模型获取途径与商用支持。
Google 联合斯坦福等机构发表研究,评估多模态 AI 工具在辅助普通用户理解皮肤病症及后续决策时的效果。在覆盖 2,345 名受试者的对照实验中,AI 辅助使病症名称的识别准确率从常规搜索的 8% 提升至 23%,但在指导用户判断是否紧急就医等下一步决策上并无显著改善。真实社区临床测试显示,图文对照匹配能成为辅助医患沟通的参考工具,但仍需更具体的行动建议来防止用户低估病情紧急度。
Google 支持加州大学圣迭戈分校开展手机集群计算研究,计划利用 2000 部退役 Pixel 手机的主板搭建低碳云算力中心。该方案剥离电池和屏幕以降低安全隐患并保留占内含碳约 50% 的主板,替换为通用 Linux 系统后通过 Kubernetes 进行容器化调度,25 至 50 部手机即可提供等效于一台现代服务器的算力。
推荐理由:方案通过拆解退役手机主板构建分布式计算集群,为数据中心降低硬件制造阶段的内含碳排放提供了可行的硬件再利用路径。
Vertiv 宣布完成对热交换与排热技术提供商 ThermoKey 的收购,以扩展其面向 AI 工厂及高密度数据中心的全链条热管理产品组合与制造能力。ThermoKey 成立于 1991 年,拥有干冷器以及兼容低 GWP 和天然制冷剂的换热技术;交易完成后,其位于意大利 Rivarotta 的基地将继续作为核心制造与工程枢纽,CEO Giuseppe Visentini 也将留任主持业务。
推荐理由:Vertiv 借此补强了干冷器与环保制冷剂换热产品线,旨在提升其在 EMEA 区域为高密 AI 数据中心提供全链条热管理方案的制造与交付能力。
Google 宣布在弗吉尼亚州开展新社区投资,以支持数千个当地就业岗位并提升能源可负担性。Google 资助了电气培训联盟(etA),计划到 2030 年新增培训 2,741 名学徒,并已在当地投资超 500MW 新能源容量。此外,Google 还设立了 1,500 万美元的能源影响基金,通过资助房屋修缮与能效升级降低居民水电账单支出。
通义实验室发布基于 MNN 推理引擎适配 Arm SME2 指令集的端侧大模型部署教程,提供了 Qwen3-VL-4B-Instruct 在 Android 旗舰手机上的完整落地流程。
推荐理由:文章给出了从 MNN 编译到 APK 构建的完整端侧落地流程,读者可据此复现 SME2 指令集对视觉语言模型的加速效果。
Google 旗下 Google.org 宣布承诺出资 $50 million,在全美 20 多个州培训超过 300,000 名基础设施技术工人。该资金将直接支持 14 个工会及 4 个行业承包商协会,覆盖电工、管道工、焊工和钣金工等高需求岗位,并通过引入 AI 运营工具与移动培训中心来现代化升级学徒培训体系。
Google Research 在 AISTATS 2026 提出正则化 f-散度核检验(Regularized f-Divergence Kernel Tests)框架,用于在黑盒条件下更灵敏、精确地审计机器学习模型的机器遗忘效果。
Google DeepMind 推出开源实验模型 DiffusionGemma,采用 Apache 2.0 协议发布,通过扩散机制替代传统的自回归逐 token 生成,在专用 GPU 上实现最高 4 倍的文本生成速度。
推荐理由:原文对比了扩散文本生成与传统自回归模型在硬件瓶颈与吞吐上的差异,为开发者评估本地实时交互工作流提供了参考。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并在 Google.org 支持下,宣布设立高达 $10M 的全球技术研究资助项目,推进多智能体 AI 安全研究。该项目重点资助沙盒与测试台、智能体网络科学、增强智能体基础设施以及监督与控制四大领域,旨在应对大规模 AI 智能体跨系统交互带来的群体安全风险。