跳到正文
今天9月30日周三
  1. arXiv 人工智能41

    RAO-Nav:探索全模态语言模型在零样本语义视听导航中的应用

    RAO-Nav 提出了一种利用全模态语言模型(OLM)实现零样本语义视听导航(SAVN)的部署流程。该方案引入测试时潜在导航推理(LNR)模块,在无需任何训练数据的情况下,在公开 SAVN 基准测试中超越了现有的 SOTA 基线。研究还提出了全局导航指令设定以进一步评估具身智能体能力,并已开源代码。

  2. arXiv 人工智能44

    GameBoyWorlds:具身视频游戏中智能体自我提升的测试平台

    研究团队推出测试平台 GameBoyWorlds,用于评估 AI 智能体在无示范与奖励环境下的自主自我提升能力。其包含涵盖 5 个游戏系列共 500 项短程任务的 Execution 子集,前沿模型开箱完成率不足 50%;Playthrough 子集则测试两款宝可梦同人游戏的端到端通关。实验表明,配备多模态记忆与分层子目标的高级智能体管线仍未能达成首个主要里程碑。

  3. AITNT · AI头条(网页)12

    AITNT 发布多项 AI 产业项目融资与技术对接需求

    AITNT 平台发布多项人工智能商业对接与融资需求,涵盖智能制造、具身智能及数字化服务等领域。其中,具身智能服务机器人研发与智塑未来 5 轴增材制造平台分别寻求 2000 万元融资,多模态运动分析系统拟融资 1000 万元。此外,平台还发布了纺织智能监测、室内设计大模型应用及包装装备升级等技术合作需求。

  4. AITNT · AI头条(网页)46

    寰宇心生(WorldMind)完成数千万元种子轮融资

    神经认知世界模型公司寰宇心生(WorldMind)完成数千万元人民币种子轮融资,由元生资本投资、点石资本担任独家财务顾问。本轮资金将主要用于核心技术研发、训练基础设施建设、多模态数据采集及团队扩张。公司主打“记忆—知识—推演—校准”闭环架构,并在 World Arena 2.0 评测中位列 Track 1 前三与 Track 2 第二。

  5. IT168 服务器存储 · AI与算力(网页)23

    华硕天选 Air 与破晓系列 AI PC 亮相,英特尔发布具身智能开发套件

    华硕开售搭载 AMD 锐龙 AI Max+ 388 处理器的天选 Air 2026 笔记本,并开启破晓 Air 预约,推出深度融合腾讯 WorkBuddy 智能体的全新商用 PC 矩阵。同时,英特尔在产业生态大会上展示端侧与物理 AI 布局,正式发布英特尔具身智能开发套件,以硬件算力赋能端侧工作流。

  6. IT168 服务器存储 · AI与算力(网页)22

    IT168 AI与算力行业最新动态速览

    近期AI与具身智能领域迎来多项进展,华为云在华为全联接大会期间发起“城市公共云合伙人行动”并推进Agentic Cloud布局。具身智能企业智身科技宣布完成数亿元人民币B轮融资,蚂蚁灵波科技与阿拉伯数字经济联盟签署合作备忘录。此外,微软推出AG-UI的.NET SDK,宇树科技等厂商持续加速机器人场景落地。

  7. AITNT · AI头条(网页)89

    AMD 宣布以约 82 亿美元全股票收购李飞飞空间智能初创公司 World Labs

    AMD 正式宣布与李飞飞创立的初创公司 World Labs 签署协议,将以全股票方式出资约 82 亿美元(约合 550 亿元人民币)进行收购,交易预计在 2026 年底前完成。

    推荐理由:AMD 通过收购将前沿空间智能研究绑定自身芯片体系,旨在为物理 AI 与机器人工作负载的软硬件协同提前布局。

  8. Ars Technica · AI 筛选81

    AMD 宣布以 82 亿美元收购李飞飞创立的世界模型初创公司 World Labs

    AMD 与世界模型初创公司 World Labs 联合宣布,AMD 将在年底前以 82 亿美元收购 World Labs,交易尚待监管批准。World Labs 由李飞飞等人于 2024 年创立,专注于研发可模拟物理世界的 AI 模型并推出了 Marble 等 3D 生成工具。该收购将补齐 AMD 在机器人合成数据训练与世界模型技术栈上的能力。

    推荐理由:AMD 通过收购李飞飞团队补齐物理世界模拟能力,有助于在机器人合成数据领域缩小与竞争对手的技术差距。

9月29日周二
  1. Data Center Knowledge86

    AMD 拟以 82 亿美元收购 World Labs,李飞飞将出任首席科学家

    AMD 宣布达成全股票收购协议,拟以约 82 亿美元收购空间智能研究机构 World Labs,交易预计于 2026 年底前完成。World Labs 联合创始人兼 CEO 李飞飞将在交易完成后出任 AMD 执行副总裁兼首席科学家,团队将继续聚焦 AI 模型研究。该收购旨在协同设计面向机器人与物理 AI 的硬件、软件及机架级系统,进一步缩小与行业先发者的技术差距。

    推荐理由:AMD 借此补齐空间世界模型研发能力与顶尖人才,意在将具身智能计算需求前置融入其底层芯片与系统架构设计。

  2. 量子位40

    正行创新联合创始人杨宇欣出任总裁,负责全球业务拓展

    正行创新(Striding AI)宣布联合创始人杨宇欣正式出任公司总裁,全面负责全球市场拓展、产业生态建设与商业化落地。杨宇欣此前曾任黑芝麻智能首席市场营销官及中科创达副总裁,拥有二十余年跨科技领域产业经验。他将推动正行创新的具身模型、本体及软件等全栈能力进入更多真实商业与工业场景,加速全球规模化落地。

  3. 爱范儿 · AI 筛选89

    AMD 宣布以 82 亿美元收购李飞飞创立的 World Labs

    AMD 宣布与李飞飞创立的空间智能公司 World Labs 签署最终协议,将以全股票方式作价约 82 亿美元进行收购,交易预计在 2026 年底前完成。交易完成后李飞飞将出任 AMD 执行副总裁兼首席科学家,团队将继续推进三维环境生成与机器人仿真模型的研发。AMD 计划通过软硬件协同开发,针对物理 AI、机器人与仿真等未来多样化计算负载优化底层计算基础设施。

    推荐理由:芯片厂商通过整合空间智能与三维仿真模型团队,展示了将算法研究深度绑定硬件设计的生态布局路径。

  4. 量子位49

    诺因智能再获数亿元融资,成立一年累计融资超10亿元

    消费级具身智能公司诺因智能近日完成由京东相关基金领投的数亿元天使+++轮融资,成立一年累计融资额超10亿元人民币。本轮资金将用于提升GLOW具身大模型的泛化能力,并推进机器人本体KNOWIN-X1的工程验证与量产准备。其GLOW模型在RoboDojo 18项仿真任务中取得62.2%平均成功率,且公司已吸纳陈颖聪、邓世元加盟研发团队。

  5. 爱范儿 · AI 筛选44

    对话一目科技:机器人缺失的“手感”,如何用“光”来搞定

    一目科技通过“光触觉”路线与超薄仿生触觉传感器 SENTRA T0,为具身智能机器人补齐精巧操作所需的触觉感知。SENTRA T0 厚度在 3 毫米以下,在指尖大小面积布置了 24 万个感知点,测力精度达约 5mN 并支持侧向摩擦力感知。该方案通过光探测柔性材质形变反算受力,破解了灵巧手“装不下”及物理触觉数据匮乏的难题。

  6. arXiv 人工智能38

    Metro-WM:基于可实现子目标的长程隐空间规划

    研究人员提出分层规划框架 Metro-WM,通过从先验经验中检索真实状态而非生成未落地的隐向量来设定子目标,解决了 JEPA 长程规划中子目标物理不可实现的问题。实验显示,Metro-WM 的长程成功率比次优分层方法高出最多 37.33 个百分点,速度提升最高达 10.9 倍,离线计算量减少 13-56 倍。该方法支持偏航即时重规划,并在极稀疏数据下保持稳健。

  7. arXiv 人工智能36

    DriveHierarchy:从开环理解到闭环执行诊断 VLM 自动驾驶能力的评测基准

    研究人员提出分层评测基准 DriveHierarchy,将基于 VLM 的自动驾驶能力划分为感知定位、上下文记忆、思维推理与闭环执行四级架构。该基准整合开源数据集构建出包含 84,279 帧和 76,798 个问答对的开环评测,并基于真实路网开发出包含 100 个交互场景的闭环仿真平台。在 15 个 VLM 上的实验表明,该基准能有效关联开环理解与闭环驾驶表现,为模型诊断与优化提供依据。

  8. arXiv 人工智能39

    ConflictVLA-Bench:评测 VLA 模型对前提冲突的行为响应

    研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。

9月25日周五
  1. 爱范儿 · AI 筛选29

    早报|网易云音乐鸿蒙版正式上线,任正非重申「华为不造车」,腾讯 QClaw 将停运

    任正非在与东风汽车会谈时重申华为不造车,将继续发挥智能化特长协助东风造好车。同时,网易云音乐鸿蒙版正式上线并支持多端互通,腾讯 AI 助手 QClaw 宣布将于 12 月 24 日停运且数据可迁至 WorkBuddy。此外,报道称 DeepSeek 年化收入运行率达 10 亿美元,谷歌面向企业推出了 Gemini 3.8 Live Avatar 实时虚拟形象。

9月24日周四
  1. Microsoft Research63

    微软推出具身智能推理云边卸载方案并上线工具集

    微软研究院针对物理具身智能(Physical AI)推出推理卸载方案与工具集,指出将 AI 推理从机器人板载 GPU 卸载至边缘或云端可显著突破算力瓶颈并延长续航。

    推荐理由:原文系统量化了机器人端侧与云边协同推理的性能与能耗权衡,为具身智能系统的分布式算力架构设计提供了实测参考。

9月22日周二
  1. NVIDIA · AI 筛选71

    NVIDIA 发布 Isaac ROS 5.0,引入智能体工作流与物理 AI 支持

    NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。

    推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。

9月17日周四
  1. Apple Machine Learning Research39

    REVERSAL-BENCH:用于度量无重置强化学习断崖的可逆性轴与重置预言机

    研究人员推出强化学习基准 REVERSAL-BENCH,通过连续参数 ρ∈ [0, 1] 控制环境可逆性,并提供验证状态可恢复性的重置预言机。评测显示无重置智能体存在显著的可逆性断崖,会永久陷入不可恢复状态导致学习终止,证实该崩溃因果性地由不可逆性驱动。该基准套件涵盖 5 个物理引擎中的 8 种操作设置并开放数据集。

9月14日周一
  1. MIT News · AI49

    MIT 提出新方法让 AI 适用于安全关键场景

    MIT 研究团队开发出即插即用算法 HardFlow,让生成式 AI 模型无需重训即可在部署时严格满足安全等硬约束,且不牺牲输出质量。该方法将采样重构为轨迹优化问题,仅在最终输出端强制执行约束以保留生成自由度。在机器人操控与迷宫导航等实验中,HardFlow 实现了完美的约束满足,解的质量与效率均优于现有基线方法。

9月2日周三
9月1日周二
8月27日周四
  1. Anthropic News(RSS)74

    Anthropic 开放模型硬件标准 MHS 研究预览,支持 AI 智能体跨设备控制物理硬件

    Anthropic 宣布开启模型硬件标准(MHS)的研究预览,该共享规范旨在让 AI 智能体安全操作显微镜、移液器和机械臂等各类科研与制造硬件。MHS 引入标准化驱动程序,通过基础读写原语和自然语言元数据让设备具备可发现性,并支持通过 MCP、CLI 及代码文件与模型协同,将硬件集成时间从数周缩短至数小时。

    推荐理由:该标准将原本需要数周的实验室跨设备集成缩短至数小时内,展示了智能体通过统一协议调度物理硬件的工程路径。

8月14日周五
  1. Hugging Face66

    借助 Strands Agents、LeRobot 与 Hugging Face Storage Buckets 实现机器人数据采集、训练与部署闭环

    Hugging Face 与 AWS 联合展示了通过 Strands Robots、LeRobot 和 Hugging Face Storage Buckets 构建机器人端到端流式数据闭环的方法。

    推荐理由:原文给出了基于 Storage Buckets 增量去重与流式读取的端到端机器人闭环实践,读者可据此降低具身智能数据传输与存储开销。

8月11日周二
7月31日周五
  1. MIT News · AI40

    MIT CSAIL 主任 Daniela Rus 获巴伐利亚州长高科技奖

    MIT CSAIL 主任 Daniela Rus 获得 2026 年巴伐利亚州长高科技奖,以表彰其在机器人、AI 和自主系统领域的开创性贡献。评审委员会重点认可了她在自组织机器人集群、软体机器人、自主移动及类脑 AI 等方向的成果。她还参与发明了仅需 19 个控制神经元即可操控车辆的液体神经网络,并据此联合创立了 Liquid AI。

7月30日周四
  1. Google DeepMind81

    Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,支持连续视频理解与多机协同

    Google DeepMind 正式发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层认知大脑,通过连续视频流理解实现任务编排与多机器人协同作业。

    推荐理由:该模型展示了将高层视频流推理与底层动作执行解耦的设计路径,对探索多智能体协作与复杂物理任务闭环具有参考价值。

7月28日周二
7月27日周一
  1. Hugging Face74

    NVIDIA 推出 Cosmos-H-Dreams:面向手术机器人的实时生成式仿真世界模型

    NVIDIA 推出面向手术机器人的实时动作条件生成式仿真世界模型 Cosmos-H-Dreams,并开源了模型权重、推理代码和训练配方。该模型通过因果预热与自强制蒸馏技术将 Cosmos-H-Surgical-Simulator 压缩为少步扩散学生模型,配合 FlashDreams 流式推理库在单张 RTX PRO 6000 GPU 上实现约 160 fps 的交互式生成。

    推荐理由:原文给出了自回归世界模型蒸馏与低延迟流式推理方案,读者可以据此了解如何通过生成式仿真替代高成本的物理实体评测。

7月21日周二
  1. Hugging Face72

    Hugging Face 开源机器人操作数据采集系统 Grabette

    Hugging Face 联合 Pollen Robotics 开源了低成本机器人操作数据采集系统 Grabette,无需真机遥操作即可通过手持夹爪录制示教数据并自动转换为训练格式。

    推荐理由:项目开源了低成本手持示教硬件与自动化处理流,为具身智能数据采集提供了摆脱昂贵遥操作机械臂的可复现方案。