跳到正文
7月6日周一
  1. 通义实验室 公众号54

    通义实验室发布 Fun-ASR-Realtime 实时语音识别模型

    通义实验室发布 Fun-ASR-Realtime 语音识别模型,单模型支持 30 种语言与 16 种方言,并在工业级方言测评中取得 87.8% 的语义准确率。该模型采用流式与非流式一体化训练,首字延迟控制在百毫秒级,支持动态注入热词与对话上下文以实现同音词和领域词消歧,相关 API 已上线阿里云百炼平台。

  2. Hugging Face70

    Hugging Face Kernels 迎来重大更新:上线内核仓库类型并支持智能体内核开发

    Hugging Face 宣布对 🤗 Kernels 项目进行全面重构与更新,在 Hub 上正式推出了全新的 kernel 仓库类型。新版本引入了受信任发布者机制与基于 Sigstore cosign 的临时私钥代码签名,并将加载工具 kernels 与构建工具 kernel-builder 的 CLI 彻底解耦。

    推荐理由:通过统一内核仓库类型并结合代码签名与受信任发布机制,为底层算力优化与智能体生成内核提供了标准化的安全分发底座。

7月3日周五
  1. Google DeepMind63

    Google DeepMind 与影视制作公司 A24 达成研究合作,Google 同步完成投资

    Google DeepMind 宣布与独立电影制片发行公司 A24 达成长期研发合作,Google 同时已对 A24 完成投资。双方将把 DeepMind 的前沿技术研究直接融入影视创作者的实际工作流,借助一线艺术家的反馈共同探索和塑造下一代影视创作工具与叙事形式。

    推荐理由:该合作将前沿 AI 技术直接接入专业影视制作流程,为观察生成式工具在电影工业中的研发与落地提供了样本。

7月1日周三
  1. Vertiv 官方新闻59

    Vertiv 在马来西亚柔佛启用新制造基地,扩充 AI 电力与液冷基础设施产能

    Vertiv 宣布在马来西亚柔佛启用全新制造基地,扩充在亚洲的制造布局,以支持东南亚、北亚、澳大利亚和新西兰地区对 AI 及高密度算力基础设施的需求。该工厂提供先进热管理与电力基础设施的端到端制造、组装与全尺寸见证测试,预计于 2027 年全面投入运营并提供数百个技术岗位。

  2. Hugging Face74

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 的实时语音流水线

    Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。

    推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。

  3. Google Research46

    Google Research 将热韧性数据扩展至全球 50+ 个城市

    Google Research 扩展了建筑级屋顶反射率数据集并面向全球 50+ 个城市开放,通过新上线的 Heat Resilience Earth Engine App 提供访问与下载。该方案结合 Sentinel-2 与 30-cm 分辨率卫星影像及机器学习模型,反照率地图 RMSE 达到 0.04,旨在辅助城市规划凉爽屋顶以缓解最高 0.5°C 的极端高温。

6月30日周二
  1. Hugging Face52

    Dharma AI 深度解析:为何 AI 走向专业化是必然趋势

    Dharma AI 结合 Yann LeCun 等人 2026 年的研究论文,阐明 AI 走向领域专业化而非盲目追求通用的理论依据与现实必然性。文章从优化理论(没有免费午餐定理)、进化生物学、市场竞争选择以及机器学习实践(如负迁移、MoE 架构和 AlphaFold)四个维度论证,在资源有限的约束下,针对特定任务的资源集中与匹配度始终优于宽泛覆盖。

  2. Google Research73

    Google Research 发布表格数据零样本基础模型 TabFM

    Google Research 推出针对表格数据的零样本基础模型 TabFM,将表格预测重构为上下文学习任务,无需手动训练、特征工程与超参数微调即可在单次前向传递中完成分类与回归。

    推荐理由:通过将表格预测重塑为上下文学习任务并结合因果合成数据预训练,为结构化数据分类与回归提供了无需调参的零样本推理方案。

  3. Hugging Face62

    Hugging Face 模型页面支持展示 Every Eval Ever 评测结果与互通集成

    Hugging Face 与 EvalEval 联盟的 Every Eval Ever(EEE)达成互通,支持将标准化的 AI 评测记录直接同步至 Hugging Face 模型页面与对应的数据集排行榜。

    推荐理由:打通标准化评测数据与模型展示页面,有助于降低跨平台维护评测记录的成本,并让基准得分直接溯源至完整运行配置。

  4. Hugging Face41

    DiScoFormer:跨分布统一估计密度与分数的 Transformer 模型

    研究人员提出 DiScoFormer(Density and Score Transformer),通过单次前向传播即可同时估计任意数据集的概率密度与分数(Score),无需针对新分布重新训练。模型采用共享 Transformer 主干与双输出头设计,在推理时可通过无标签一致性损失自适应分布外数据。在 100 维测试中,其相比调优后的 KDE 将分数误差降低约 6.5x,密度误差降低超过 37x。

6月27日周六
  1. Google Research60

    Google 推出基于冻结权重的端侧多 Token 预测架构,Pixel 上 Gemini Nano 推理加速超 50%

    Google Research 提出一种在冻结权重基础上集成多 Token 预测(MTP)头的端侧推理加速架构,已部署于 Pixel 9 与 10 系列设备。

    推荐理由:阐述了在不重训基座模型的前提下通过跨注意力复用缓存实现端侧投机解码,为移动设备内存与能耗受限场景提供了可落地的加速方案。

  2. Kubernetes Blog62

    Kubernetes 社区明确 AI 代码贡献规范与维护策略

    Kubernetes 社区发布针对 AI 辅助贡献的治理规范,要求贡献者必须透明披露 AI 使用情况并承担全部代码责任,严禁将 AI 列为共同作者,若无法亲自解释 AI 生成的代码将被直接关闭 PR。

    推荐理由:Kubernetes 针对 AI 辅助贡献明确了透明披露与人类问责机制,为大型开源社区应对 AI 代码冲击提供了可参考的治理范式。

6月26日周五
6月25日周四
  1. Kubernetes Blog61

    Kubernetes 设备管理工作组专访:DRA 如何重塑 AI 算力与硬件调度

    Kubernetes 官方博客专访设备管理工作组三位联合主席,详解动态资源分配(DRA)毕业至 GA 后的架构演进与 AI 硬件调度实践。DRA 通过 ResourceSlice 与 ResourceClaim 声明式 API 替代了传统设备插件的粗粒度整数分配,支持 GPU 拓扑感知、MIG 切分及平台介导的动态容量共享。

    推荐理由:工作组核心成员深入剖析了 DRA 如何替代传统设备插件,为 AI 负载提供细粒度拓扑感知与动态共享调度能力。

  2. Google Research67

    Google 研究揭示推理过程如何解锁大语言模型的参数化知识记忆

    Google Research 发文揭示了大语言模型通过推理链(CoT)召回单跳事实类参数化知识的核心机制。在 Gemini-2.5 和 Qwen3-32B 等模型上的实验表明,即使面对无须逻辑拆解的简单事实问答,开启推理也能显著提升召回率,其动力来自额外 token 提供的计算缓冲效应以及生成相关背景事实的事实启动效应。

    推荐理由:研究解构了思考过程辅助大模型召回参数化知识的机制,为理解推理模型的能力边界与中间步骤优化提供了实验依据。

6月24日周三
  1. 通义实验室 公众号77

    通义实验室开源原生语言世界模型 Qwen-AgentWorld

    通义实验室正式开源原生语言世界模型 Qwen-AgentWorld 及其评测基准 AgentWorldBench。该模型基于超 1000 万条真实交互轨迹,经由继续预训练、监督微调和强化学习三阶段训练,覆盖 MCP、Search、Terminal、SWE 等文本类及 Web、OS、Android 等 GUI 类共七大领域。

    推荐理由:模型通过对环境交互显式建模来降低沙箱试错成本,为智能体强化学习和跨任务泛化提供了可控模拟路径。

6月18日周四
  1. 通义实验室 公众号66

    统一科学大模型 LOGOS 正式开源

    通义实验室联合中国人民大学高瓴人工智能学院开源统一科学大模型 LOGOS,将蛋白质、小分子和材料等异构科学对象编码为统一离散序列。模型基于 7 类模态共 44.87B tokens 语料预训练,无需显式 3D 坐标即可建模空间互作规律,并在配体生成、逆合成预测等六大任务上匹敌或超越领域专用方法。

    推荐理由:该模型通过离散化序列将多领域科学对象统一纳入自回归框架,展示了摆脱显式三维几何网络并复用成熟语言模型工程栈的可行路径。

6月17日周三
  1. 智谱 公众号83

    智谱上线并开源 GLM-5.2:支持 1M 上下文并强化长程编程能力

    智谱正式上线并开源 GLM-5.2 模型,遵循 MIT 协议,主打 1M 上下文与长程编程任务能力。在 FrontierSWE 等基准测试中其表现逼近 Claude Opus 4.8,并通过 IndexShare 架构优化将 1M 上下文下的单位 token FLOPs 降低至 2.9 倍。

    推荐理由:模型主打长程编程任务与长上下文支持,结合架构优化降低推理算力消耗,为长链路软件工程落地提供了开源参考。

  2. Google Research43

    Google Earth AI 从像素到规划:助力自然生态恢复

    Google 发布英格兰精细生态要素的矢量化数据集,利用基于超 3 亿张卫星图像预训练的 Vision-Transformer(ViT)模型识别传统卫星难以检测的树篱、石墙和小树林。该方案结合亚米级图像与 1 米 LiDAR 数据,覆盖英格兰逾 13 万平方公里区域,解决了要素重叠与跨图块拼接等计算难题。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI 控制路线图以保障智能体系统安全

    Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与智能体安全技术框架,提出将潜在失齐的 AI 智能体视为内部威胁的系统级纵深防御体系。

    推荐理由:文章提出了将潜在失齐智能体视为内部威胁的系统级防御框架,为自主系统的实时监督与分级拦截提供了落地参考。

  2. 通义实验室 公众号78

    通义实验室发布具身智能基础模型套件 Qwen-Robot

    通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。

    推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。

6月15日周一
  1. Google Infrastructure62

    Google 宣布投资 15 亿美元扩建阿拉巴马州数据中心园区

    Google 宣布在 2026 和 2027 年投资 15 亿美元,扩建位于美国阿拉巴马州杰克逊县的数据中心园区。该园区自 2019 年在废弃燃煤电厂旧址上改造运营,Google 将 100% 全额自费承担所有电力与基础设施成本。同时 Google 设立了 200 万美元能源影响基金并捐助 55 万美元 STEM 教育物资,以支持当地社区。

    推荐理由:Google 全额承担用电与配套基建成本扩建旧燃煤电厂园区,为大型企业应对电网负荷审查提供了基建扩容参考。

6月13日周六
  1. 智谱 公众号80

    智谱宣布 GLM-5.2 全量开放并即将开源

    智谱宣布 GLM-5.2 全量开放,该模型支持 1M 上下文并主打长程任务与代码能力。GLM-5.2 将面向 GLM Coding Plan 全量用户(Lite / Pro / Max / 团队版)开放,其 API 将于下周上线,模型也将于下周遵循 MIT 协议正式开源。

    推荐理由:原文给出了上线节奏、版本开放范围和开源协议,开发者可以据此了解模型获取途径与商用支持。

  2. Google Research53

    Google 研究探讨 AI 如何辅助用户理解皮肤疾病

    Google 联合斯坦福等机构发表研究,评估多模态 AI 工具在辅助普通用户理解皮肤病症及后续决策时的效果。在覆盖 2,345 名受试者的对照实验中,AI 辅助使病症名称的识别准确率从常规搜索的 8% 提升至 23%,但在指导用户判断是否紧急就医等下一步决策上并无显著改善。真实社区临床测试显示,图文对照匹配能成为辅助医患沟通的参考工具,但仍需更具体的行动建议来防止用户低估病情紧急度。

  3. Google Research65

    Google 与加州大学圣迭戈分校探索用 2000 部退役手机构建低碳算力平台

    Google 支持加州大学圣迭戈分校开展手机集群计算研究,计划利用 2000 部退役 Pixel 手机的主板搭建低碳云算力中心。该方案剥离电池和屏幕以降低安全隐患并保留占内含碳约 50% 的主板,替换为通用 Linux 系统后通过 Kubernetes 进行容器化调度,25 至 50 部手机即可提供等效于一台现代服务器的算力。

    推荐理由:方案通过拆解退役手机主板构建分布式计算集群,为数据中心降低硬件制造阶段的内含碳排放提供了可行的硬件再利用路径。

6月12日周五
  1. Vertiv 官方新闻65

    Vertiv 完成对散热方案商 ThermoKey 的收购

    Vertiv 宣布完成对热交换与排热技术提供商 ThermoKey 的收购,以扩展其面向 AI 工厂及高密度数据中心的全链条热管理产品组合与制造能力。ThermoKey 成立于 1991 年,拥有干冷器以及兼容低 GWP 和天然制冷剂的换热技术;交易完成后,其位于意大利 Rivarotta 的基地将继续作为核心制造与工程枢纽,CEO Giuseppe Visentini 也将留任主持业务。

    推荐理由:Vertiv 借此补强了干冷器与环保制冷剂换热产品线,旨在提升其在 EMEA 区域为高密 AI 数据中心提供全链条热管理方案的制造与交付能力。

  2. Google Infrastructure40

    Google 在弗吉尼亚州开展新社区投资,支持当地就业与能源可负担性

    Google 宣布在弗吉尼亚州开展新社区投资,以支持数千个当地就业岗位并提升能源可负担性。Google 资助了电气培训联盟(etA),计划到 2030 年新增培训 2,741 名学徒,并已在当地投资超 500MW 新能源容量。此外,Google 还设立了 1,500 万美元的能源影响基金,通过资助房屋修缮与能效升级降低居民水电账单支出。

6月11日周四
  1. 通义实验室 公众号66

    通义实验室详解 MNN 适配 Arm SME2:Qwen3-VL-4B 端侧 Prefill 提速 81%

    通义实验室发布基于 MNN 推理引擎适配 Arm SME2 指令集的端侧大模型部署教程,提供了 Qwen3-VL-4B-Instruct 在 Android 旗舰手机上的完整落地流程。

    推荐理由:文章给出了从 MNN 编译到 APK 构建的完整端侧落地流程,读者可据此复现 SME2 指令集对视觉语言模型的加速效果。

  2. Google Infrastructure49

    Google 承诺出资 $50 million 培养下一代美国技术工人

    Google 旗下 Google.org 宣布承诺出资 $50 million,在全美 20 多个州培训超过 300,000 名基础设施技术工人。该资金将直接支持 14 个工会及 4 个行业承包商协会,覆盖电工、管道工、焊工和钣金工等高需求岗位,并通过引入 AI 运营工具与移动培训中心来现代化升级学徒培训体系。

  3. Google DeepMind82

    Google DeepMind 开源 DiffusionGemma:基于扩散机制的 26B 文本生成模型

    Google DeepMind 推出开源实验模型 DiffusionGemma,采用 Apache 2.0 协议发布,通过扩散机制替代传统的自回归逐 token 生成,在专用 GPU 上实现最高 4 倍的文本生成速度。

    推荐理由:原文对比了扩散文本生成与传统自回归模型在硬件瓶颈与吞吐上的差异,为开发者评估本地实时交互工作流提供了参考。

6月10日周三
  1. Google DeepMind50

    Google DeepMind 资助多智能体 AI 安全研究

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并在 Google.org 支持下,宣布设立高达 $10M 的全球技术研究资助项目,推进多智能体 AI 安全研究。该项目重点资助沙盒与测试台、智能体网络科学、增强智能体基础设施以及监督与控制四大领域,旨在应对大规模 AI 智能体跨系统交互带来的群体安全风险。