微软推出具身智能推理云边卸载方案并上线工具集
微软研究院针对物理具身智能(Physical AI)推出推理卸载方案与工具集,指出将 AI 推理从机器人板载 GPU 卸载至边缘或云端可显著突破算力瓶颈并延长续航。
推荐理由:原文系统量化了机器人端侧与云边协同推理的性能与能耗权衡,为具身智能系统的分布式算力架构设计提供了实测参考。
微软研究院针对物理具身智能(Physical AI)推出推理卸载方案与工具集,指出将 AI 推理从机器人板载 GPU 卸载至边缘或云端可显著突破算力瓶颈并延长续航。
推荐理由:原文系统量化了机器人端侧与云边协同推理的性能与能耗权衡,为具身智能系统的分布式算力架构设计提供了实测参考。
NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。
推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。
Anthropic 宣布开启模型硬件标准(MHS)的研究预览,该共享规范旨在让 AI 智能体安全操作显微镜、移液器和机械臂等各类科研与制造硬件。MHS 引入标准化驱动程序,通过基础读写原语和自然语言元数据让设备具备可发现性,并支持通过 MCP、CLI 及代码文件与模型协同,将硬件集成时间从数周缩短至数小时。
推荐理由:该标准将原本需要数周的实验室跨设备集成缩短至数小时内,展示了智能体通过统一协议调度物理硬件的工程路径。
Hugging Face 与 AWS 联合展示了通过 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人端到端流式数据闭环的方法。
推荐理由:原文给出了基于 Storage Buckets 增量去重与流式读取的端到端机器人闭环实践,读者可据此降低具身智能数据传输与存储开销。
Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。
推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。
Google DeepMind 推出 Gemini Robotics 2 机器人模型系列,支持人形机器人全身运动协同控制、高灵巧度手部操作与多机器人协作。
推荐理由:该系列将视觉语言动作模型扩展至全身控制与端侧适配,使硬件团队能用极少样本迁移到不同形态的机器人。
NVIDIA 推出面向手术机器人的实时动作条件生成式仿真世界模型 Cosmos-H-Dreams,并开源了模型权重、推理代码和训练配方。该模型通过因果预热与自强制蒸馏技术将 Cosmos-H-Surgical-Simulator 压缩为少步扩散学生模型,配合 FlashDreams 流式推理库在单张 RTX PRO 6000 GPU 上实现约 160 fps 的交互式生成。
推荐理由:原文给出了自回归世界模型蒸馏与低延迟流式推理方案,读者可以据此了解如何通过生成式仿真替代高成本的物理实体评测。
Hugging Face 联合 Pollen Robotics 开源了低成本机器人操作数据采集系统 Grabette,无需真机遥操作即可通过手持夹爪录制示教数据并自动转换为训练格式。
推荐理由:项目开源了低成本手持示教硬件与自动化处理流,为具身智能数据采集提供了摆脱昂贵遥操作机械臂的可复现方案。
Hugging Face 发布开源机器人学习库 LeRobot v0.6.0,引入世界模型策略、统一奖励模型 API 与人机回环部署 CLI,全面构建机器人学习闭环。
推荐理由:新版本通过集成世界模型、奖励模型评估与人机协同干预工具链,为具身智能策略的闭环训练与快速部署提供了可复用的标准化工程流程。
Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。
推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。
通义实验室正式推出具身智能基础模型套件 Qwen-Robot,通过模块化协同弥合视觉语言理解到物理行动的鸿沟。套件包含负责多任务移动控制的 Qwen-RobotNav、统一 80 维跨本体操作表征的 VLA 模型 Qwen-RobotManip,以及基于双流 MMDiT 预测物理演化的世界模型 Qwen-RobotWorld。
推荐理由:原文给出了导航、操作与世界模型三模块的协同架构,读者可据此了解具身大模型统一跨本体动作空间的落地路径。
Google DeepMind 宣布在实验性原型 Project Genie 中接入 Google 街景图像能力,允许用户基于真实地理位置生成可交互的虚拟世界。
推荐理由:结合街景图像生成可交互世界,为 AI 智能体与机器人导航提供了锚定真实地理数据的虚拟仿真环境。
Google DeepMind 推出专为机器人设计的 Gemini Robotics-ER 1.6 具身推理模型,重点增强了空间推理、多视角理解、任务规划与成功检测能力。
推荐理由:原文给出了空间推理、多视角理解和工业仪表读数等具体能力,读者可以据此了解高层推理模型如何接入机器人控制链路。