跳到正文
9月29日周二
  1. 爱范儿 · AI 筛选44

    对话一目科技:机器人缺失的“手感”,如何用“光”来搞定

    一目科技通过“光触觉”路线与超薄仿生触觉传感器 SENTRA T0,为具身智能机器人补齐精巧操作所需的触觉感知。SENTRA T0 厚度在 3 毫米以下,在指尖大小面积布置了 24 万个感知点,测力精度达约 5mN 并支持侧向摩擦力感知。该方案通过光探测柔性材质形变反算受力,破解了灵巧手“装不下”及物理触觉数据匮乏的难题。

  2. arXiv 自然语言处理26

    基于共享表征与领域特定头的 IMU 数字笔年龄自适应笔迹重建

    针对 IMU 数字笔在成人与儿童间因书写习惯差异导致的泛化难题,研究团队提出了一种基于时间卷积网络(TCN)与多预测头的跨领域笔迹重建架构。该方法通过共享特征与领域特定头捕捉不同年龄段的运动特征,无需用户个性化适配即可直接部署在笔端。该设计改善了传感器轨迹重建表现,并实现了两类人群数据的跨域互益。

  3. arXiv 人工智能39

    ConflictVLA-Bench:评测 VLA 模型对前提冲突的行为响应

    研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。

9月25日周五
  1. 爱范儿 · AI 筛选29

    早报|网易云音乐鸿蒙版正式上线,任正非重申「华为不造车」,腾讯 QClaw 将停运

    任正非在与东风汽车会谈时重申华为不造车,将继续发挥智能化特长协助东风造好车。同时,网易云音乐鸿蒙版正式上线并支持多端互通,腾讯 AI 助手 QClaw 宣布将于 12 月 24 日停运且数据可迁至 WorkBuddy。此外,报道称 DeepSeek 年化收入运行率达 10 亿美元,谷歌面向企业推出了 Gemini 3.8 Live Avatar 实时虚拟形象。

9月24日周四
  1. Engineering at Meta67

    Meta 为 AI 眼镜引入机密计算基础设施 Private Processing

    Meta 宣布将机密计算基础设施 Private Processing 扩展至 Meta AI 眼镜,把眼镜端的信任边界延伸至云端机密虚拟机(CVM),确保即使处理高负载 AI 任务,Meta 也无法访问用户数据。

    推荐理由:原文给出了 AI 眼镜在端云协同中兼顾长期记忆与机密计算的架构设计,有助于了解端侧智能硬件在云端大模型算力卸载时的隐私安全方案。

  2. Microsoft Research63

    微软推出具身智能推理云边卸载方案并上线工具集

    微软研究院针对物理具身智能(Physical AI)推出推理卸载方案与工具集,指出将 AI 推理从机器人板载 GPU 卸载至边缘或云端可显著突破算力瓶颈并延长续航。

    推荐理由:原文系统量化了机器人端侧与云边协同推理的性能与能耗权衡,为具身智能系统的分布式算力架构设计提供了实测参考。

9月22日周二
  1. NVIDIA Developer Blog65

    NVIDIA 发布 DLSS 5 并带来 ACE 与 RTX Kit 多项更新

    NVIDIA 推出 DLSS 5 并引入 3D 导向神经渲染技术,为开发者提供更细粒度的光照与材质控制能力。同时更新还涵盖角色 AI 工具 NVIDIA ACE、RTX Mega Geometry 2.0 以及 RTX Kit,针对高密度几何体与渲染工作流进行了功能扩展。

    推荐理由:原文汇总了神经渲染与角色工具的技术更新,读者可借此了解新特性对画质控制与图形工作流的改变。

  2. NVIDIA · AI 筛选71

    NVIDIA 发布 Isaac ROS 5.0,引入智能体工作流与物理 AI 支持

    NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。

    推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。

9月17日周四
  1. NVIDIA Developer Blog40

    TensorRT Edge-LLM 在 Jetson AGX Thor 上运行 MLPerf 边缘智能体基准测试提速 6.4 倍

    TensorRT Edge-LLM 在 NVIDIA Jetson AGX Thor 上将 MLPerf Edge 智能体基准测试的完成速度提升了 6.4 倍。随着 AI 智能体从云端数据中心走向汽车、机器人等边缘设备,其需要执行工具选择与长对话推理等多步工作流,对边缘推理的速度和 token 生成能力提出了更高要求。

9月1日周二
8月27日周四
  1. Anthropic News(RSS)74

    Anthropic 开放模型硬件标准 MHS 研究预览,支持 AI 智能体跨设备控制物理硬件

    Anthropic 宣布开启模型硬件标准(MHS)的研究预览,该共享规范旨在让 AI 智能体安全操作显微镜、移液器和机械臂等各类科研与制造硬件。MHS 引入标准化驱动程序,通过基础读写原语和自然语言元数据让设备具备可发现性,并支持通过 MCP、CLI 及代码文件与模型协同,将硬件集成时间从数周缩短至数小时。

    推荐理由:该标准将原本需要数周的实验室跨设备集成缩短至数小时内,展示了智能体通过统一协议调度物理硬件的工程路径。

8月14日周五
  1. Hugging Face66

    借助 Strands Agents、LeRobot 与 Hugging Face Storage Buckets 实现机器人数据采集、训练与部署闭环

    Hugging Face 与 AWS 联合展示了通过 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人端到端流式数据闭环的方法。

    推荐理由:原文给出了基于 Storage Buckets 增量去重与流式读取的端到端机器人闭环实践,读者可据此降低具身智能数据传输与存储开销。

7月30日周四
  1. Google DeepMind81

    Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,支持连续视频理解与多机协同

    Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。

    推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。

7月28日周二
7月27日周一
  1. Hugging Face74

    NVIDIA 推出 Cosmos-H-Dreams:面向手术机器人的实时生成式仿真世界模型

    NVIDIA 推出面向手术机器人的实时动作条件生成式仿真世界模型 Cosmos-H-Dreams,并开源了模型权重、推理代码和训练配方。该模型通过因果预热与自强制蒸馏技术将 Cosmos-H-Surgical-Simulator 压缩为少步扩散学生模型,配合 FlashDreams 流式推理库在单张 RTX PRO 6000 GPU 上实现约 160 fps 的交互式生成。

    推荐理由:原文给出了自回归世界模型蒸馏与低延迟流式推理方案,读者可以据此了解如何通过生成式仿真替代高成本的物理实体评测。

7月21日周二
  1. Hugging Face72

    Hugging Face 开源机器人操作数据采集系统 Grabette

    Hugging Face 联合 Pollen Robotics 开源了低成本机器人操作数据采集系统 Grabette,无需真机遥操作即可通过手持夹爪录制示教数据并自动转换为训练格式。

    推荐理由:项目开源了低成本手持示教硬件与自动化处理流,为具身智能数据采集提供了摆脱昂贵遥操作机械臂的可复现方案。

7月9日周四
  1. MIT News · AI48

    MIT 研发 FloatForm 微型机器人船,可自主组装浮动结构

    MIT 团队研发出名为 FloatForm 的微型机器人船系统,单艇仅 21 厘米见方,可在水面自主拼装成桥梁或平台等浮动结构并随时重构。该系统借鉴火蚁结筏机制采用分布式并行协同架构,规划复杂度仅取决于邻近节点,全群支持同时移动与协同航行。实验中 8 艘机器人可在 4 至 8 分钟内完成组装与重构,仿真验证已支持 64 艘规模扩展。

7月7日周二
  1. Hugging Face84

    Hugging Face 机器人学习框架 LeRobot v0.6.0 发布

    Hugging Face 发布开源机器人学习库 LeRobot v0.6.0,引入世界模型策略、统一奖励模型 API 与人机回环部署 CLI,全面构建机器人学习闭环。

    推荐理由:新版本通过集成世界模型、奖励模型评估与人机协同干预工具链,为具身智能策略的闭环训练与快速部署提供了可复用的标准化工程流程。

7月1日周三
  1. Hugging Face74

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 的实时语音流水线

    Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。

    推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。

6月23日周二
6月9日周二
  1. Google DeepMind54

    Google DeepMind 推出欧洲机器人加速器计划并公布首批15家入选企业

    Google DeepMind 启动为期 3 个月的欧洲机器人加速器计划,选拔了来自英国、法国、德国等国家的 15 家早期机器人初创公司入选。入选企业将获得 Google 与 Google DeepMind 专家的导师指导,并可直接接入其 AI 技术栈与 Gemini 机器人模型。这批初创公司的业务覆盖焊接质检、神经外科微型机器人、建筑微工厂、海洋自主作业与人形机器人数据采集等具身智能应用领域。

5月18日周一
4月13日周一
11月25日周二
7月31日周四
  1. SemiAnalysis · 算力产业68

    SemiAnalysis 提出机器人五级自主性分级框架

    SemiAnalysis 发布机器人五级自主性分类体系(Robotics Levels of Autonomy),从自主规划(Agency)与灵巧度(Dexterity)两个维度将机器人划分为 Level 0 至 Level 4 五个阶段。

    推荐理由:原文基于自主规划与操作灵巧度两项维度划分出五级机器人自主性框架,读者可借此建立对通用机器人商业化落地节奏的系统认知。