对话一目科技:机器人缺失的“手感”,如何用“光”来搞定
一目科技通过“光触觉”路线与超薄仿生触觉传感器 SENTRA T0,为具身智能机器人补齐精巧操作所需的触觉感知。SENTRA T0 厚度在 3 毫米以下,在指尖大小面积布置了 24 万个感知点,测力精度达约 5mN 并支持侧向摩擦力感知。该方案通过光探测柔性材质形变反算受力,破解了灵巧手“装不下”及物理触觉数据匮乏的难题。
一目科技通过“光触觉”路线与超薄仿生触觉传感器 SENTRA T0,为具身智能机器人补齐精巧操作所需的触觉感知。SENTRA T0 厚度在 3 毫米以下,在指尖大小面积布置了 24 万个感知点,测力精度达约 5mN 并支持侧向摩擦力感知。该方案通过光探测柔性材质形变反算受力,破解了灵巧手“装不下”及物理触觉数据匮乏的难题。
针对 IMU 数字笔在成人与儿童间因书写习惯差异导致的泛化难题,研究团队提出了一种基于时间卷积网络(TCN)与多预测头的跨领域笔迹重建架构。该方法通过共享特征与领域特定头捕捉不同年龄段的运动特征,无需用户个性化适配即可直接部署在笔端。该设计改善了传感器轨迹重建表现,并实现了两类人群数据的跨域互益。
研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。
任正非在与东风汽车会谈时重申华为不造车,将继续发挥智能化特长协助东风造好车。同时,网易云音乐鸿蒙版正式上线并支持多端互通,腾讯 AI 助手 QClaw 宣布将于 12 月 24 日停运且数据可迁至 WorkBuddy。此外,报道称 DeepSeek 年化收入运行率达 10 亿美元,谷歌面向企业推出了 Gemini 3.8 Live Avatar 实时虚拟形象。
Meta 宣布将机密计算基础设施 Private Processing 扩展至 Meta AI 眼镜,把眼镜端的信任边界延伸至云端机密虚拟机(CVM),确保即使处理高负载 AI 任务,Meta 也无法访问用户数据。
推荐理由:原文给出了 AI 眼镜在端云协同中兼顾长期记忆与机密计算的架构设计,有助于了解端侧智能硬件在云端大模型算力卸载时的隐私安全方案。
微软研究院针对物理具身智能(Physical AI)推出推理卸载方案与工具集,指出将 AI 推理从机器人板载 GPU 卸载至边缘或云端可显著突破算力瓶颈并延长续航。
推荐理由:原文系统量化了机器人端侧与云边协同推理的性能与能耗权衡,为具身智能系统的分布式算力架构设计提供了实测参考。
NVIDIA 推出 DLSS 5 并引入 3D 导向神经渲染技术,为开发者提供更细粒度的光照与材质控制能力。同时更新还涵盖角色 AI 工具 NVIDIA ACE、RTX Mega Geometry 2.0 以及 RTX Kit,针对高密度几何体与渲染工作流进行了功能扩展。
推荐理由:原文汇总了神经渲染与角色工具的技术更新,读者可借此了解新特性对画质控制与图形工作流的改变。
NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。
推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。
NVIDIA 介绍了如何结合 AI 智能体与 NVIDIA Isaac ROS 加速 ROS 2 节点。针对消息在节点间传递时因 CPU 内存序列化与数据复制、从而削弱 GPU 运行感知与 AI 工作负载优势的问题,NVIDIA 提供了上游抽象机制与 CUDA buffer backend 解决方案。
NVIDIA 详解面向物理 AI 的全栈安全系统 NVIDIA Halos,覆盖自动驾驶与机器人领域从底层硬件、操作系统、端到端模型到仿真验证的全生命周期安全保障。
AI 智能体工作流可用于为物理 AI 系统准备与验证数字孪生。智能体能够检查 3D 场景、在 OpenUSD 中编写仿真数据、添加物理属性、渲染预检视图,并根据 SimReady 标准验证结果。该工作流实现了从 Blender 场景到面向 NVIDIA 仿真就绪 OpenUSD 资产交付的完整过程。
TensorRT Edge-LLM 在 NVIDIA Jetson AGX Thor 上将 MLPerf Edge 智能体基准测试的完成速度提升了 6.4 倍。随着 AI 智能体从云端数据中心走向汽车、机器人等边缘设备,其需要执行工具选择与长对话推理等多步工作流,对边缘推理的速度和 token 生成能力提出了更高要求。
NVIDIA Omniverse NuRec 助力自动驾驶感知系统跨不同车型平台实现扩展适配。当同一套感知软件从 SUV 迁移到轿车等新车型时,传感器布局、标定、视场角、遮挡、车身几何及覆盖范围等均会改变,进而导致交通信号灯等目标在画面中的成像位置发生偏移。
机器人导航需结合持续定位、环境理解、路径规划与避障来安全到达目标,将感知与运动转化为自主行为。与仅提供稳定运动的基础移动能力不同,将导航能力迁移至新机器人或新场景通常需要新的数据、仿真资产以及机器人接口。
Anthropic 宣布开启模型硬件标准(MHS)的研究预览,该共享规范旨在让 AI 智能体安全操作显微镜、移液器和机械臂等各类科研与制造硬件。MHS 引入标准化驱动程序,通过基础读写原语和自然语言元数据让设备具备可发现性,并支持通过 MCP、CLI 及代码文件与模型协同,将硬件集成时间从数周缩短至数小时。
推荐理由:该标准将原本需要数周的实验室跨设备集成缩短至数小时内,展示了智能体通过统一协议调度物理硬件的工程路径。
Hugging Face 与 AWS 联合展示了通过 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人端到端流式数据闭环的方法。
推荐理由:原文给出了基于 Storage Buckets 增量去重与流式读取的端到端机器人闭环实践,读者可据此降低具身智能数据传输与存储开销。
Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。
推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。
Google DeepMind 推出 Gemini Robotics 2 机器人模型系列,支持人形机器人全身运动协同控制、高灵巧度手部操作与多机器人协作。
推荐理由:该系列将视觉语言动作模型扩展至全身控制与端侧适配,使硬件团队能用极少样本迁移到不同形态的机器人。
NVIDIA 推出面向手术机器人的实时动作条件生成式仿真世界模型 Cosmos-H-Dreams,并开源了模型权重、推理代码和训练配方。该模型通过因果预热与自强制蒸馏技术将 Cosmos-H-Surgical-Simulator 压缩为少步扩散学生模型,配合 FlashDreams 流式推理库在单张 RTX PRO 6000 GPU 上实现约 160 fps 的交互式生成。
推荐理由:原文给出了自回归世界模型蒸馏与低延迟流式推理方案,读者可以据此了解如何通过生成式仿真替代高成本的物理实体评测。
Hugging Face 联合 Pollen Robotics 开源了低成本机器人操作数据采集系统 Grabette,无需真机遥操作即可通过手持夹爪录制示教数据并自动转换为训练格式。
推荐理由:项目开源了低成本手持示教硬件与自动化处理流,为具身智能数据采集提供了摆脱昂贵遥操作机械臂的可复现方案。
MIT 团队研发出名为 FloatForm 的微型机器人船系统,单艇仅 21 厘米见方,可在水面自主拼装成桥梁或平台等浮动结构并随时重构。该系统借鉴火蚁结筏机制采用分布式并行协同架构,规划复杂度仅取决于邻近节点,全群支持同时移动与协同航行。实验中 8 艘机器人可在 4 至 8 分钟内完成组装与重构,仿真验证已支持 64 艘规模扩展。
Hugging Face 发布开源机器人学习库 LeRobot v0.6.0,引入世界模型策略、统一奖励模型 API 与人机回环部署 CLI,全面构建机器人学习闭环。
推荐理由:新版本通过集成世界模型、奖励模型评估与人机协同干预工具链,为具身智能策略的闭环训练与快速部署提供了可复用的标准化工程流程。
Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。
推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。
MIT 研究人员开发出名为 Gleanmer 的片上系统芯片,能让微型自主机器人与电池受限设备以约 6 milliwatts 的超低功耗实时构建详尽的 3D 环境地图。
Google DeepMind 启动为期 3 个月的欧洲机器人加速器计划,选拔了来自英国、法国、德国等国家的 15 家早期机器人初创公司入选。入选企业将获得 Google 与 Google DeepMind 专家的导师指导,并可直接接入其 AI 技术栈与 Gemini 机器人模型。这批初创公司的业务覆盖焊接质检、神经外科微型机器人、建筑微工厂、海洋自主作业与人形机器人数据采集等具身智能应用领域。
Google DeepMind 宣布在实验性原型 Project Genie 中接入 Google 街景图像能力,允许用户基于真实地理位置生成可交互的虚拟世界。
推荐理由:结合街景图像生成可交互世界,为 AI 智能体与机器人导航提供了锚定真实地理数据的虚拟仿真环境。
Google DeepMind 推出专为机器人设计的 Gemini Robotics-ER 1.6 具身推理模型,重点增强了空间推理、多视角理解、任务规划与成功检测能力。
推荐理由:原文给出了空间推理、多视角理解和工业仪表读数等具体能力,读者可以据此了解高层推理模型如何接入机器人控制链路。
AWS 介绍了在云端部署 NVIDIA Cosmos 世界基础模型(WFMs)的两种生产就绪架构,用于为自动驾驶、机器人和智能工厂等物理 AI 大规模生成合成训练数据。
SemiAnalysis 发布机器人五级自主性分类体系(Robotics Levels of Autonomy),从自主规划(Agency)与灵巧度(Dexterity)两个维度将机器人划分为 Level 0 至 Level 4 五个阶段。
推荐理由:原文基于自主规划与操作灵巧度两项维度划分出五级机器人自主性框架,读者可借此建立对通用机器人商业化落地节奏的系统认知。