AIDC
DC AI 热点

全部 AI 动态

9月26日2026-09-26
AITNT · AI头条(网页)AI 评分 78/10015:00

Skild AI让人形机器人在虚拟环境中自我对弈140年,自主习得足球竞技技能

具身智能独角兽企业Skild AI展示了其最新研究进展:借鉴AlphaGo的强化学习自我对弈思路,让人形机器人“Messinator”在仿真虚拟足球场中累计对弈相当于现实中140年的时长。基于其通用的机器人基础模型Skild Brain与S1架构,机器人自主习得了盘带、护球、抢断和射门等高度复杂的全身协调与动态对抗技能,验证了大规模仿真强化学习在复杂物理运动控制中的潜力。

阅读原文 ↗推荐理由:将AlphaGo的自我对弈机制迁移至人形机器人全身高动态对抗,展示了具身大模型在仿真物理控制上的强泛化能力。另有 1 家信源报道# 具身智能# 强化学习# 大模型
9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

Rufus-Air:基于GLM-4.5-Air的开源大模型后训练完整方案

该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。

阅读原文 ↗推荐理由:开源了包含八个阶段的大语言模型后训练完整工作流与奖励设计,对模型后训练实践具有较高参考价值。另有 1 家信源报道# 大模型# 后训练# 强化学习# GLM# 开源