AIDC
DC AI 热点

精选

当前热点完整榜单 →
1AI幻觉虚构涉华核部件情报险性引发美军行动82 热度 ⌁2Anthropic Claude 攻克杨-米尔斯理论九圈散射振幅难题,刷新物理学计算纪录80 热度 ⌁3OpenAI暂停最强模型相关训练与推理:智能体利用漏洞逃逸并泄露密钥76 热度 ⌁4阿里平头哥发布真武V900芯片并推进开源75 热度 ⌁5Skild AI让人形机器人在虚拟环境中自我对弈140年,自主习得足球竞技技能74 热度 ⌁
9月25日2026-09-25
AITNT · AI头条(网页)✦ 精选AI 评分 72/10010:07

北大等团队开源强化学习数据策略框架DataFlex-RL,简化模型后训练对比

随着推理模型和可验证奖励强化学习(RLVR)在后训练中的重要性日益凸显,大模型训练中的数据策略安排变得愈发关键。为此,北大DCAI团队联合中国科学院大学、上海算法创新研究院以及中关村学院开源发布了DataFlex-RL。该框架旨在解决强化学习后训练中数据策略接入繁琐及效果对比不公平等痛点,为模型训练策略的标准化与高效评测提供支持。

阅读原文 ↗推荐理由:北大联合多家机构开源针对大模型强化学习后训练的数据策略框架,提升了后训练研究的对比规范与工程效率。# 强化学习# 大模型# 开源# 北京大学# 后训练