AIDC
← 返回全部动态
AITNT · AI头条(网页)AI 评分 72/10009月25日 10:07

北大等团队开源强化学习数据策略框架DataFlex-RL,简化模型后训练对比

随着推理模型和可验证奖励强化学习(RLVR)在后训练中的重要性日益凸显,大模型训练中的数据策略安排变得愈发关键。为此,北大DCAI团队联合中国科学院大学、上海算法创新研究院以及中关村学院开源发布了DataFlex-RL。该框架旨在解决强化学习后训练中数据策略接入繁琐及效果对比不公平等痛点,为模型训练策略的标准化与高效评测提供支持。

推荐理由北大联合多家机构开源针对大模型强化学习后训练的数据策略框架,提升了后训练研究的对比规范与工程效率。

原标题:日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

阅读 AITNT · AI头条(网页) 原文 ↗

同一事件的其他来源

arXiv 自然语言处理09月25日 12:00

Rufus-Air:基于GLM-4.5-Air的开源大模型后训练完整方案

该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。