一句话看懂:Hugging Face 工程师 Sergio Paniego 用 TRL 和 OpenEnv 全流程开源复现了“让编码模型通过写 JavaScript 画水彩画”的训练项目,将审美偏好作为强化学习奖励,所有数据集、环境、模型与训练脚本均已公开。
事件核心:发生了什么
今年 8 月,开发者 Surya Narreddi 发布了一段由语言模型通过 p5.brush 库编写 JavaScript 绘制水彩画的视频,观看量超过 150 万。原项目展示了模型如何用约 150 行代码控制笔触,仅限使用库中 10 种方法作画,风格接近手工水彩而非常见图像模型生成的“完美平均图”。Hugging Face 的 Sergio Paniego 随后从工程侧复现了这一想法,将完整流程跑在 Hugging Face 生态上:数据集、RL 环境、评分模型、成对裁判模型和训练脚本全部开源,并集中在一个模型库中。
复现项目使用 Qwen/Qwen3.5-35B-A3B 作为基座模型,通过 LoRA 微调和 GRPO 强化学习训练,在 Jobs 服务上运行。作者构建了可交互的 RL 环境 Space 和评分模型 Space,用户只需设置两个环境变量并运行一条命令,即可训练模型绘制指定主题的水彩。项目还比较了三种不同奖励混合策略(reward mix)的并行训练效果,并以每步的中位数画作直观呈现模型进化过程。
为什么重要
这个项目的价值不在于“模型能画画”,而在于它演示了一条与主流 RLVR(可验证奖励强化学习)不同的路线:将审美偏好作为奖励信号来训练模型。当前大部分针对语言模型的强化学习集中在数学、代码测试等有确定答案的任务上,而本项目的奖励来自“人对美的判断”,更接近早期 RLHF 的思路,但把偏好信号直接用于强化学习环境而非单独训练奖励模型。
从技术路线看,它属于“用代码作画”的生成范式——模型输出的不是像素而是可读、可编辑、可重跑的 JavaScript 程序,每一步笔触决策都透明可见。这与端到端图像生成模型形成鲜明对比。同时,整个训练管线完全跑在 Hugging Face 开放平台上(Jobs 训练、Spaces 部署环境、Inference Providers 运行成对裁判模型),为复现和二次开发提供了一个完整的开源参考实现。在当下闭源模型能力持续提升但透明度下降的背景下,这种“每一步都公开”的做法值得关注。
对用户/开发者/创作者的影响
对开发者而言,如果你对“用强化学习训练模型执行具身或交互式任务”感兴趣,这个项目提供了一个可直接跑通的模板。环境、奖励设计、训练脚本均为开放代码,可以尝试替换数据集或奖励组合来训练不同风格的生成模型,不必从零搭建 RL 训练管线。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者和设计师来说,这个项目展示了一种介于“直接生成图片”和“手写代码”之间的创作方式:模型生成的是程序,你可以阅读、修改并重新运行它,每个笔触背后都有可追溯的决策逻辑。这种可控性对希望将 AI 纳入创作流程而非替代创作过程的人有一定参考价值。原作者的出发点也在艺术与设计侧,项目中的手工筛选图像池(hand-rated pool)本身就是一种策展式数据集构建方式。
对普通用户,目前公开信息显示该项目仍以技术复现为主,尚未提供可直接体验的在线 Demo 或产品化入口,但模型和 Space 已开源,感兴趣的用户可以自行部署体验。
值得关注的后续
第一,原作者 Surya Narreddi 表示完整技术报告即将发布,届时可对比其原始训练方法与本次开源复现之间的差异。第二,当前项目仅使用了 10 种 p5.brush 库方法,如果放宽或替换方法集合,模型是否能画出更复杂的水彩构图,值得观察。第三,审美偏好作为奖励信号的训练范式是否会被更多项目采用,尤其是在图像生成、视频生成或交互式创作工具的开发中,这是值得跟踪的方向。另一个观察点是 Hugging Face Jobs 加 Spaces 这套全云端训练部署组合是否会成为开源 AI 项目复现的主流基础设施。


