基于 TRL 与 OpenEnv 训练代码模型绘制水彩画的开源实践
Hugging Face 工程师开源了基于 TRL 与 OpenEnv 的强化学习训练管线,复现了通过代码生成水彩画的方法。该方案采用 Qwen3.5-35B-A3B 编写约 150 行 p5.brush 的 JavaScript 代码,结合 HPSv3 美学评分模型与 Qwen3-VL 成对评判器构建主观审美奖励函数,利用 GRPO 强化学习引导模型对齐特定绘画风格。
推荐理由:原文完整开源了用强化学习引导代码模型绘制水彩画的工程管线,展示了如何将人工审美偏好构建为成对比较的奖励函数。