Arm 公布覆盖端云及物理 AI 的全场景计算架构,推出 CSS for Mobile 2 与 AGI CPU
Arm 在 Arm Everywhere China 大会上公布了覆盖边缘、物理世界与云端的全场景 AI 计算底座,推出第二代移动终端计算子系统 CSS for Mobile 2、Neoverse CSS N4、Arm AGI CPU 以及开发者工具 Arm AI Portal。
Arm 在 Arm Everywhere China 大会上公布了覆盖边缘、物理世界与云端的全场景 AI 计算底座,推出第二代移动终端计算子系统 CSS for Mobile 2、Neoverse CSS N4、Arm AGI CPU 以及开发者工具 Arm AI Portal。
研究人员提出一种缓存感知 Conv3D lowering 优化方法,将因果 Conv3D 调用表达为批处理空间 Conv2D 操作,以提升嵌入式端世界模型的运行效率。
RAO-Nav 提出了一种利用全模态语言模型(OLM)实现零样本语义视听导航(SAVN)的部署流程。该方案引入测试时潜在导航推理(LNR)模块,在无需任何训练数据的情况下,在公开 SAVN 基准测试中超越了现有的 SOTA 基线。研究还提出了全局导航指令设定以进一步评估具身智能体能力,并已开源代码。
研究团队推出测试平台 GameBoyWorlds,用于评估 AI 智能体在无示范与奖励环境下的自主自我提升能力。其包含涵盖 5 个游戏系列共 500 项短程任务的 Execution 子集,前沿模型开箱完成率不足 50%;Playthrough 子集则测试两款宝可梦同人游戏的端到端通关。实验表明,配备多模态记忆与分层子目标的高级智能体管线仍未能达成首个主要里程碑。
AITNT 平台发布多项人工智能商业对接与融资需求,涵盖智能制造、具身智能及数字化服务等领域。其中,具身智能服务机器人研发与智塑未来 5 轴增材制造平台分别寻求 2000 万元融资,多模态运动分析系统拟融资 1000 万元。此外,平台还发布了纺织智能监测、室内设计大模型应用及包装装备升级等技术合作需求。
斯坦福团队推出具身智能项目 HomeBody,让大模型通过工具调用方式控制宇树 G1 人形机器人,在无需新环境专用训练的前提下完成收拾厨房与开抽屉取药等复合任务。
神经认知世界模型公司寰宇心生(WorldMind)完成数千万元人民币种子轮融资,由元生资本投资、点石资本担任独家财务顾问。本轮资金将主要用于核心技术研发、训练基础设施建设、多模态数据采集及团队扩张。公司主打“记忆—知识—推演—校准”闭环架构,并在 World Arena 2.0 评测中位列 Track 1 前三与 Track 2 第二。
香港大学等机构研究团队提出 3D 场景生成框架 SceneMosaic,通过将单图结构化为层级场景树并引入 Critic-Actor 智能体局部演化与笛卡尔积组合,高效生成物理合理且多样的仿真房间。
华硕开售搭载 AMD 锐龙 AI Max+ 388 处理器的天选 Air 2026 笔记本,并开启破晓 Air 预约,推出深度融合腾讯 WorkBuddy 智能体的全新商用 PC 矩阵。同时,英特尔在产业生态大会上展示端侧与物理 AI 布局,正式发布英特尔具身智能开发套件,以硬件算力赋能端侧工作流。
近期AI与具身智能领域迎来多项进展,华为云在华为全联接大会期间发起“城市公共云合伙人行动”并推进Agentic Cloud布局。具身智能企业智身科技宣布完成数亿元人民币B轮融资,蚂蚁灵波科技与阿拉伯数字经济联盟签署合作备忘录。此外,微软推出AG-UI的.NET SDK,宇树科技等厂商持续加速机器人场景落地。
AMD 正式宣布与李飞飞创立的初创公司 World Labs 签署协议,将以全股票方式出资约 82 亿美元(约合 550 亿元人民币)进行收购,交易预计在 2026 年底前完成。
推荐理由:AMD 通过收购将前沿空间智能研究绑定自身芯片体系,旨在为物理 AI 与机器人工作负载的软硬件协同提前布局。
AMD 与世界模型初创公司 World Labs 联合宣布,AMD 将在年底前以 82 亿美元收购 World Labs,交易尚待监管批准。World Labs 由李飞飞等人于 2024 年创立,专注于研发可模拟物理世界的 AI 模型并推出了 Marble 等 3D 生成工具。该收购将补齐 AMD 在机器人合成数据训练与世界模型技术栈上的能力。
推荐理由:AMD 通过收购李飞飞团队补齐物理世界模拟能力,有助于在机器人合成数据领域缩小与竞争对手的技术差距。
AMD 宣布达成全股票收购协议,拟以约 82 亿美元收购空间智能研究机构 World Labs,交易预计于 2026 年底前完成。World Labs 联合创始人兼 CEO 李飞飞将在交易完成后出任 AMD 执行副总裁兼首席科学家,团队将继续聚焦 AI 模型研究。该收购旨在协同设计面向机器人与物理 AI 的硬件、软件及机架级系统,进一步缩小与行业先发者的技术差距。
推荐理由:AMD 借此补齐空间世界模型研发能力与顶尖人才,意在将具身智能计算需求前置融入其底层芯片与系统架构设计。
正行创新(Striding AI)宣布联合创始人杨宇欣正式出任公司总裁,全面负责全球市场拓展、产业生态建设与商业化落地。杨宇欣此前曾任黑芝麻智能首席市场营销官及中科创达副总裁,拥有二十余年跨科技领域产业经验。他将推动正行创新的具身模型、本体及软件等全栈能力进入更多真实商业与工业场景,加速全球规模化落地。
AMD 宣布与李飞飞创立的空间智能公司 World Labs 签署最终协议,将以全股票方式作价约 82 亿美元进行收购,交易预计在 2026 年底前完成。交易完成后李飞飞将出任 AMD 执行副总裁兼首席科学家,团队将继续推进三维环境生成与机器人仿真模型的研发。AMD 计划通过软硬件协同开发,针对物理 AI、机器人与仿真等未来多样化计算负载优化底层计算基础设施。
推荐理由:芯片厂商通过整合空间智能与三维仿真模型团队,展示了将算法研究深度绑定硬件设计的生态布局路径。
消费级具身智能公司诺因智能近日完成由京东相关基金领投的数亿元天使+++轮融资,成立一年累计融资额超10亿元人民币。本轮资金将用于提升GLOW具身大模型的泛化能力,并推进机器人本体KNOWIN-X1的工程验证与量产准备。其GLOW模型在RoboDojo 18项仿真任务中取得62.2%平均成功率,且公司已吸纳陈颖聪、邓世元加盟研发团队。
一目科技通过“光触觉”路线与超薄仿生触觉传感器 SENTRA T0,为具身智能机器人补齐精巧操作所需的触觉感知。SENTRA T0 厚度在 3 毫米以下,在指尖大小面积布置了 24 万个感知点,测力精度达约 5mN 并支持侧向摩擦力感知。该方案通过光探测柔性材质形变反算受力,破解了灵巧手“装不下”及物理触觉数据匮乏的难题。
研究人员提出分层规划框架 Metro-WM,通过从先验经验中检索真实状态而非生成未落地的隐向量来设定子目标,解决了 JEPA 长程规划中子目标物理不可实现的问题。实验显示,Metro-WM 的长程成功率比次优分层方法高出最多 37.33 个百分点,速度提升最高达 10.9 倍,离线计算量减少 13-56 倍。该方法支持偏航即时重规划,并在极稀疏数据下保持稳健。
研究人员提出分层评测基准 DriveHierarchy,将基于 VLM 的自动驾驶能力划分为感知定位、上下文记忆、思维推理与闭环执行四级架构。该基准整合开源数据集构建出包含 84,279 帧和 76,798 个问答对的开环评测,并基于真实路网开发出包含 100 个交互场景的闭环仿真平台。在 15 个 VLM 上的实验表明,该基准能有效关联开环理解与闭环驾驶表现,为模型诊断与优化提供依据。
研究人员提出一种确定性多数据集谓词框架,可从几何、运动学与地图等数据推导驾驶场景语义,并在 nuPlan 与 nuScenes 数据集上构建通用谓词知识图谱(Predicate KG)。
研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。
任正非在与东风汽车会谈时重申华为不造车,将继续发挥智能化特长协助东风造好车。同时,网易云音乐鸿蒙版正式上线并支持多端互通,腾讯 AI 助手 QClaw 宣布将于 12 月 24 日停运且数据可迁至 WorkBuddy。此外,报道称 DeepSeek 年化收入运行率达 10 亿美元,谷歌面向企业推出了 Gemini 3.8 Live Avatar 实时虚拟形象。
微软研究院针对物理具身智能(Physical AI)推出推理卸载方案与工具集,指出将 AI 推理从机器人板载 GPU 卸载至边缘或云端可显著突破算力瓶颈并延长续航。
推荐理由:原文系统量化了机器人端侧与云边协同推理的性能与能耗权衡,为具身智能系统的分布式算力架构设计提供了实测参考。
NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。
推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。
NVIDIA 介绍了如何结合 AI 智能体与 NVIDIA Isaac ROS 加速 ROS 2 节点。针对消息在节点间传递时因 CPU 内存序列化与数据复制、从而削弱 GPU 运行感知与 AI 工作负载优势的问题,NVIDIA 提供了上游抽象机制与 CUDA buffer backend 解决方案。
NVIDIA 详解面向物理 AI 的全栈安全系统 NVIDIA Halos,覆盖自动驾驶与机器人领域从底层硬件、操作系统、端到端模型到仿真验证的全生命周期安全保障。
研究人员推出强化学习基准 REVERSAL-BENCH,通过连续参数 ρ∈ [0, 1] 控制环境可逆性,并提供验证状态可恢复性的重置预言机。评测显示无重置智能体存在显著的可逆性断崖,会永久陷入不可恢复状态导致学习终止,证实该崩溃因果性地由不可逆性驱动。该基准套件涵盖 5 个物理引擎中的 8 种操作设置并开放数据集。
AI 智能体工作流可用于为物理 AI 系统准备与验证数字孪生。智能体能够检查 3D 场景、在 OpenUSD 中编写仿真数据、添加物理属性、渲染预检视图,并根据 SimReady 标准验证结果。该工作流实现了从 Blender 场景到面向 NVIDIA 仿真就绪 OpenUSD 资产交付的完整过程。
MIT 研究团队开发出即插即用算法 HardFlow,让生成式 AI 模型无需重训即可在部署时严格满足安全等硬约束,且不牺牲输出质量。该方法将采样重构为轨迹优化问题,仅在最终输出端强制执行约束以保留生成自由度。在机器人操控与迷宫导航等实验中,HardFlow 实现了完美的约束满足,解的质量与效率均优于现有基线方法。
MIT 与自动驾驶公司 Motional 联合研发出概念封装网络(CW-Net),能将基于深度学习的自动驾驶规划器黑盒决策转化为因果忠实的人类可理解概念,研究发表于 Nature。
NVIDIA Omniverse NuRec 助力自动驾驶感知系统跨不同车型平台实现扩展适配。当同一套感知软件从 SUV 迁移到轿车等新车型时,传感器布局、标定、视场角、遮挡、车身几何及覆盖范围等均会改变,进而导致交通信号灯等目标在画面中的成像位置发生偏移。
机器人导航需结合持续定位、环境理解、路径规划与避障来安全到达目标,将感知与运动转化为自主行为。与仅提供稳定运动的基础移动能力不同,将导航能力迁移至新机器人或新场景通常需要新的数据、仿真资产以及机器人接口。
Anthropic 宣布开启模型硬件标准(MHS)的研究预览,该共享规范旨在让 AI 智能体安全操作显微镜、移液器和机械臂等各类科研与制造硬件。MHS 引入标准化驱动程序,通过基础读写原语和自然语言元数据让设备具备可发现性,并支持通过 MCP、CLI 及代码文件与模型协同,将硬件集成时间从数周缩短至数小时。
推荐理由:该标准将原本需要数周的实验室跨设备集成缩短至数小时内,展示了智能体通过统一协议调度物理硬件的工程路径。
Hugging Face 与 AWS 联合展示了通过 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人端到端流式数据闭环的方法。
推荐理由:原文给出了基于 Storage Buckets 增量去重与流式读取的端到端机器人闭环实践,读者可据此降低具身智能数据传输与存储开销。
MIT CSAIL 与清华大学等机构研究人员推出物理预训练方法 GeoPT,利用 130 万个合成动力学样本让模型预先掌握基础物理规律,提升 3D 物理场景仿真能力。
MIT CSAIL 主任 Daniela Rus 获得 2026 年巴伐利亚州长高科技奖,以表彰其在机器人、AI 和自主系统领域的开创性贡献。评审委员会重点认可了她在自组织机器人集群、软体机器人、自主移动及类脑 AI 等方向的成果。她还参与发明了仅需 19 个控制神经元即可操控车辆的液体神经网络,并据此联合创立了 Liquid AI。
Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。
推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。
Google DeepMind 推出 Gemini Robotics 2 机器人模型系列,支持人形机器人全身运动协同控制、高灵巧度手部操作与多机器人协作。
推荐理由:该系列将视觉语言动作模型扩展至全身控制与端侧适配,使硬件团队能用极少样本迁移到不同形态的机器人。
NVIDIA 推出面向手术机器人的实时动作条件生成式仿真世界模型 Cosmos-H-Dreams,并开源了模型权重、推理代码和训练配方。该模型通过因果预热与自强制蒸馏技术将 Cosmos-H-Surgical-Simulator 压缩为少步扩散学生模型,配合 FlashDreams 流式推理库在单张 RTX PRO 6000 GPU 上实现约 160 fps 的交互式生成。
推荐理由:原文给出了自回归世界模型蒸馏与低延迟流式推理方案,读者可以据此了解如何通过生成式仿真替代高成本的物理实体评测。
Hugging Face 联合 Pollen Robotics 开源了低成本机器人操作数据采集系统 Grabette,无需真机遥操作即可通过手持夹爪录制示教数据并自动转换为训练格式。
推荐理由:项目开源了低成本手持示教硬件与自动化处理流,为具身智能数据采集提供了摆脱昂贵遥操作机械臂的可复现方案。