MIT 与微软推出 Murakkab 系统:提升 AI 智能体工作流速度与能效
MIT 与微软 Azure 研究人员开发了名为 Murakkab 的智能系统,可通过自然语言意图自动优化 AI 智能体工作流的组件组合与云端硬件资源调度。在视频问答与代码生成等工作流测试中,该系统仅消耗传统方法约 35% 的计算量、27% 的能耗以及不到 25% 的成本,同时满足用户的延迟与准确率约束。
MIT 与微软 Azure 研究人员开发了名为 Murakkab 的智能系统,可通过自然语言意图自动优化 AI 智能体工作流的组件组合与云端硬件资源调度。在视频问答与代码生成等工作流测试中,该系统仅消耗传统方法约 35% 的计算量、27% 的能耗以及不到 25% 的成本,同时满足用户的延迟与准确率约束。
Kubernetes 官方博客专访设备管理工作组三位联合主席,详解动态资源分配(DRA)毕业至 GA 后的架构演进与 AI 硬件调度实践。DRA 通过 ResourceSlice 与 ResourceClaim 声明式 API 替代了传统设备插件的粗粒度整数分配,支持 GPU 拓扑感知、MIG 切分及平台介导的动态容量共享。
推荐理由:工作组核心成员深入剖析了 DRA 如何替代传统设备插件,为 AI 负载提供细粒度拓扑感知与动态共享调度能力。
Google Research 发文揭示了大语言模型通过推理链(CoT)召回单跳事实类参数化知识的核心机制。在 Gemini-2.5 和 Qwen3-32B 等模型上的实验表明,即使面对无须逻辑拆解的简单事实问答,开启推理也能显著提升召回率,其动力来自额外 token 提供的计算缓冲效应以及生成相关背景事实的事实启动效应。
推荐理由:研究解构了思考过程辅助大模型召回参数化知识的机制,为理解推理模型的能力边界与中间步骤优化提供了实验依据。
Google DeepMind 宣布在 Gemini 3.5 Flash 中原生内置 Computer Use 工具,此前该能力仅作为独立的 Gemini 2.5 专用模型提供。
推荐理由:官方将跨平台操作能力整合为主线轻量模型的内置工具,为低成本构建自动化交互智能体提供了实用参考。
通义实验室正式开源原生语言世界模型 Qwen-AgentWorld 及其评测基准 AgentWorldBench。该模型基于超 1000 万条真实交互轨迹,经由继续预训练、监督微调和强化学习三阶段训练,覆盖 MCP、Search、Terminal、SWE 等文本类及 Web、OS、Android 等 GUI 类共七大领域。
推荐理由:模型通过对环境交互显式建模来降低沙箱试错成本,为智能体强化学习和跨任务泛化提供了可控模拟路径。
MIT 研究人员开发出名为 Gleanmer 的片上系统芯片,能让微型自主机器人与电池受限设备以约 6 milliwatts 的超低功耗实时构建详尽的 3D 环境地图。
HPE 将自身支持平台迁移至基于 GreenLake Intelligence 与 Private Cloud AI 的本地基础设施,将运行成本降低 30 倍以上并月省近 10 万美元。
推荐理由:原文通过实际成本数据揭示了智能体高频交互带来的开销问题,为评估生产级 AI 推理回迁本地数据中心提供了经济性依据。
通义实验室联合中国人民大学高瓴人工智能学院开源统一科学大模型 LOGOS,将蛋白质、小分子和材料等异构科学对象编码为统一离散序列。模型基于 7 类模态共 44.87B tokens 语料预训练,无需显式 3D 坐标即可建模空间互作规律,并在配体生成、逆合成预测等六大任务上匹敌或超越领域专用方法。
推荐理由:该模型通过离散化序列将多领域科学对象统一纳入自回归框架,展示了摆脱显式三维几何网络并复用成熟语言模型工程栈的可行路径。
IDC 数据显示 2026 年第一季度全球服务器市场营收达 $122.62B,同比增长 30.4%,其中 GPU 和 XPU 加速计算系统合计贡献 $86B,占整体服务器营收的 70.2%。
推荐理由:原文结合最新行业数据量化了加速计算对传统计算的替代节奏,读者可借此了解服务器供应链成本转嫁与架构变迁格局。
智谱正式上线并开源 GLM-5.2 模型,遵循 MIT 协议,主打 1M 上下文与长程编程任务能力。在 FrontierSWE 等基准测试中其表现逼近 Claude Opus 4.8,并通过 IndexShare 架构优化将 1M 上下文下的单位 token FLOPs 降低至 2.9 倍。
推荐理由:模型主打长程编程任务与长上下文支持,结合架构优化降低推理算力消耗,为长链路软件工程落地提供了开源参考。
Google DeepMind 与英国政府、Google Cloud 及 Faculty 等合作开发了基于 Gemini 的 AI 规划审批工具原型,旨在将房主规划申请的审批决策时间缩短 50%。
AI 芯片初创公司 Tensordyne 公布了专为推理设计的 Napier 芯片及 Pareto 机柜级系统,核心是将矩阵乘法转换为底层对数加法以降低能耗。
Google 发布英格兰精细生态要素的矢量化数据集,利用基于超 3 亿张卫星图像预训练的 Vision-Transformer(ViT)模型识别传统卫星难以检测的树篱、石墙和小树林。该方案结合亚米级图像与 1 米 LiDAR 数据,覆盖英格兰逾 13 万平方公里区域,解决了要素重叠与跨图块拼接等计算难题。
Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与智能体安全技术框架,提出将潜在失齐的 AI 智能体视为内部威胁的系统级纵深防御体系。
推荐理由:文章提出了将潜在失齐智能体视为内部威胁的系统级防御框架,为自主系统的实时监督与分级拦截提供了落地参考。
通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。
推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。
结合 Gartner 与美国能源信息署等数据测算,全球数据中心用电量预计从 2024 年的 387 TWh 增长至 2030 年的至少 1,200 TWh,六年后占全球总用电量的比例将从 1.3% 升至约 3.3%。
推荐理由:文章将当前数据中心电力激增与互联网泡沫时期的预警对比,指出能效架构优化有望再次避免极端耗电假设。
Transformers 发布补丁版本 v5.12.1,更新了 PEFT 的版本下限,并修复了安装 mistral-common 时 auto tokenizer 正确解析 Mistral 分词器的问题。该版本变动类似于 v5.10.3 并剔除了主版本中已包含的修复,此外 vLLM 将首先针对 5.10.3 进行适配。
Google 宣布在 2026 和 2027 年投资 15 亿美元,扩建位于美国阿拉巴马州杰克逊县的数据中心园区。该园区自 2019 年在废弃燃煤电厂旧址上改造运营,Google 将 100% 全额自费承担所有电力与基础设施成本。同时 Google 设立了 200 万美元能源影响基金并捐助 55 万美元 STEM 教育物资,以支持当地社区。
推荐理由:Google 全额承担用电与配套基建成本扩建旧燃煤电厂园区,为大型企业应对电网负荷审查提供了基建扩容参考。
Kubernetes SIG Storage 联合主席 Xing Yang 介绍了该小组的演进历程及最新存储功能进展。VolumeGroupSnapshot 在 Kubernetes v1.36 达到 GA,支持多卷崩溃一致性快照;CSI CBT 亦在 v1.36 升至 Beta 以实现高效增量备份。
智谱宣布 GLM-5.2 全量开放,该模型支持 1M 上下文并主打长程任务与代码能力。GLM-5.2 将面向 GLM Coding Plan 全量用户(Lite / Pro / Max / 团队版)开放,其 API 将于下周上线,模型也将于下周遵循 MIT 协议正式开源。
推荐理由:原文给出了上线节奏、版本开放范围和开源协议,开发者可以据此了解模型获取途径与商用支持。
Google 联合斯坦福等机构发表研究,评估多模态 AI 工具在辅助普通用户理解皮肤病症及后续决策时的效果。在覆盖 2,345 名受试者的对照实验中,AI 辅助使病症名称的识别准确率从常规搜索的 8% 提升至 23%,但在指导用户判断是否紧急就医等下一步决策上并无显著改善。真实社区临床测试显示,图文对照匹配能成为辅助医患沟通的参考工具,但仍需更具体的行动建议来防止用户低估病情紧急度。
Google 支持加州大学圣迭戈分校开展手机集群计算研究,计划利用 2000 部退役 Pixel 手机的主板搭建低碳云算力中心。该方案剥离电池和屏幕以降低安全隐患并保留占内含碳约 50% 的主板,替换为通用 Linux 系统后通过 Kubernetes 进行容器化调度,25 至 50 部手机即可提供等效于一台现代服务器的算力。
推荐理由:方案通过拆解退役手机主板构建分布式计算集群,为数据中心降低硬件制造阶段的内含碳排放提供了可行的硬件再利用路径。
Vertiv 宣布完成对热交换与排热技术提供商 ThermoKey 的收购,以扩展其面向 AI 工厂及高密度数据中心的全链条热管理产品组合与制造能力。ThermoKey 成立于 1991 年,拥有干冷器以及兼容低 GWP 和天然制冷剂的换热技术;交易完成后,其位于意大利 Rivarotta 的基地将继续作为核心制造与工程枢纽,CEO Giuseppe Visentini 也将留任主持业务。
推荐理由:Vertiv 借此补强了干冷器与环保制冷剂换热产品线,旨在提升其在 EMEA 区域为高密 AI 数据中心提供全链条热管理方案的制造与交付能力。
Google 宣布在弗吉尼亚州开展新社区投资,以支持数千个当地就业岗位并提升能源可负担性。Google 资助了电气培训联盟(etA),计划到 2030 年新增培训 2,741 名学徒,并已在当地投资超 500MW 新能源容量。此外,Google 还设立了 1,500 万美元的能源影响基金,通过资助房屋修缮与能效升级降低居民水电账单支出。
通义实验室发布基于 MNN 推理引擎适配 Arm SME2 指令集的端侧大模型部署教程,提供了 Qwen3-VL-4B-Instruct 在 Android 旗舰手机上的完整落地流程。
推荐理由:文章给出了从 MNN 编译到 APK 构建的完整端侧落地流程,读者可据此复现 SME2 指令集对视觉语言模型的加速效果。
Google 旗下 Google.org 宣布承诺出资 $50 million,在全美 20 多个州培训超过 300,000 名基础设施技术工人。该资金将直接支持 14 个工会及 4 个行业承包商协会,覆盖电工、管道工、焊工和钣金工等高需求岗位,并通过引入 AI 运营工具与移动培训中心来现代化升级学徒培训体系。
Google Research 在 AISTATS 2026 提出正则化 f-散度核检验(Regularized f-Divergence Kernel Tests)框架,用于在黑盒条件下更灵敏、精确地审计机器学习模型的机器遗忘效果。
Google DeepMind 推出开源实验模型 DiffusionGemma,采用 Apache 2.0 协议发布,通过扩散机制替代传统的自回归逐 token 生成,在专用 GPU 上实现最高 4 倍的文本生成速度。
推荐理由:原文对比了扩散文本生成与传统自回归模型在硬件瓶颈与吞吐上的差异,为开发者评估本地实时交互工作流提供了参考。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并在 Google.org 支持下,宣布设立高达 $10M 的全球技术研究资助项目,推进多智能体 AI 安全研究。该项目重点资助沙盒与测试台、智能体网络科学、增强智能体基础设施以及监督与控制四大领域,旨在应对大规模 AI 智能体跨系统交互带来的群体安全风险。
Google DeepMind 正式发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时端到端流式语音互译,并在生成翻译时保留原说话人的语调、节奏和音高。
推荐理由:模型突破了传统轮流对话式翻译的延迟限制,通过流式生成保留说话人语调与节奏,为实时跨语言沟通提供了新方案。
Google DeepMind 推出统一且无独立编码器的多模态模型 Gemma 4 12B,支持原生音频与视觉输入,采用 Apache 2.0 协议开源。该模型移除了传统的图像和音频编码器,直接将多模态信号投影至 LLM 主干,性能接近 26B MoE 模型而内存占用减少超过一半,仅需 16GB 显存或统一内存即可在笔记本电脑本地运行。
推荐理由:模型移除了传统独立的模态编码器并直接接入语言主干,展示了在消费级硬件上兼顾原生音画输入与推理效率的轻量化方案。
Google DeepMind 启动为期 3 个月的欧洲机器人加速器计划,选拔了来自英国、法国、德国等国家的 15 家早期机器人初创公司入选。入选企业将获得 Google 与 Google DeepMind 专家的导师指导,并可直接接入其 AI 技术栈与 Gemini 机器人模型。这批初创公司的业务覆盖焊接质检、神经外科微型机器人、建筑微工厂、海洋自主作业与人形机器人数据采集等具身智能应用领域。
通义实验室联合 Efflora 团队完成技术验证,仅凭一份约 15 万字的产品调研文档,由 Qwen3.7-Max 在无人工接管下用时约 4 小时全自动交付移动端与 Web 端两套可运行应用。
推荐理由:文章详细拆解了将界面像素坐标转化为硬约束及多层验收闭环的工程实践,为大模型长程代码交付提供了可迁移的控制方法。
Google DeepMind 发布在塞拉利昂开展的预注册对照试验结果,使用基于 LearnLM 调优的 Guided Learning 辅助教学让学生数学成绩提升 0.258 个标准差,相当于 8 周内取得了 1.2 至 1.7 年的正常学习进展。
推荐理由:这项预注册对照试验用翔实数据验证了苏格拉底式引导在基础教育中的提分效果与师生交互模式。
Sebastian Raschka 发布了 2026 年 1 月至 5 月的精选大语言模型研究论文清单,重点关注混合架构、推理与强化学习等领域。文章指出今年架构设计不再局限于扩大 Transformer 规模,而是转向注意力层与 Mamba-2 或 Gated DeltaNet 交替的混合架构以提升长上下文效率。
推荐理由:作者整理了前五个月核心论文与架构趋势,读者可快速掌握混合架构与长上下文演进方向。
Google 在 Gemini Enterprise Agent Platform 中推出了由 Agentic RAG 驱动的跨语料库检索功能公开预览版,旨在解决传统单步 RAG 难以应对的多源多跳复杂业务查询问题。
推荐理由:Google推出了基于智能体工作流的多跳跨语料库检索架构,为复杂业务问答中的信息缺漏与迭代补充提供了可参考的落地机制。
DRAM 与 HBM 存储产能受限成为 AI 加速卡市场的核心瓶颈,使全球 AI 支出的上调节奏明显放缓。Gartner 数据显示,AI 基础设施预测增长主要受价格传导驱动而非产能扩张;AI 占全球 IT 支出份额已从 2024 年的 13.7% 增至 2025 年的 31.7%,持续挤压传统 IT 项目预算。
推荐理由:文章从存储产能瓶颈切入,结合预测数据分析了 AI 支出放缓及对传统 IT 预算的持续挤占。
Google Research 在 Nature 发表论文推出 PHRM 研究系统,利用智能手机前置摄像头在人脸解锁后自动采集面部视频,通过端侧深度学习算法被动估算心率与每日静息心率。
推荐理由:该研究展示了利用手机前置摄像头实现全肤色被动心率监测的技术方案,为无穿戴设备的日常健康追踪提供了实用参考。
Google 联手 Intersect 宣布在得克萨斯州 Gray 县和 Roberts 县建设 Meitner 能源中心,打造与专用清洁能源同址建设的新数据中心。该数据中心将配套专属清洁电力以减轻当地电网供电压力,采用风冷技术以限制水资源消耗,并接入 Google 全球网络支持 Search、Gmail、Maps 和 Cloud 等服务。
推荐理由:原文披露了数据中心与专属清洁能源同址建设的方案,读者可据此了解大型算力基建缓解电网与水资源压力的落地路径。
HPE 在 2026 财年第二季度实现营收 106.8 亿美元,同比增长 40%,净利润由去年同期的亏损 10.8 亿美元扭亏至 5.95 亿美元。分析测算其传统服务器销售额为 39.1 亿美元,AI 系统销售额同比增长 66% 至 15.4 亿美元,规模约为 Dell 的十分之一;并入 Juniper 的网络业务营收增至 26.9 亿美元,带动核心数据中心业务贡献了全公司超 80% 的营业利润。
推荐理由:原文通过对比 HPE 与 Dell 的传统服务器与 AI 系统销售拆分,展示了企业与主权算力市场真实的硬件采买节奏。