用代码训练AI绘画

一位开发者用强化学习训练语言模型直接编写绘图代码,生成的图片不再是“一次性提示词结果”,而是可修改、可复用的代码文件。这一实验的关键突破在于:用“两两对比”替代“绝对打分”作为奖励信号,解决了AI创作任务难以量化评估的难题。

一句话看懂:一位开发者用强化学习训练语言模型直接编写绘图代码,生成的图片不再是“一次性提示词结果”,而是可修改、可复用的代码文件。这一实验的关键突破在于:用“两两对比”替代“绝对打分”作为奖励信号,解决了AI创作任务难以量化评估的难题。

事件核心:发生了什么

开发者Surya与朋友Cameron共同完成了一个实验性项目:基于Qwen语言模型,通过强化学习(GRPO算法)训练模型输出p5.brush绘图代码,而非直接生成像素图像。系统的工作流程是一个四步闭环:模型接收文字提示(如“画一朵桃花水彩”),写出完整的JavaScript绘图脚本,在沙盒化的Puppeteer环境中渲染为PNG图片,再由裁判模型对渲染结果进行评判,将评判结果转化为奖励信号更新模型权重。

项目最关键的工程改进在于奖励机制的重构。最初版本使用9个独立信号(包括编译检查、代码长度控制、HPSv3人类偏好模型、GPT-5.4与Gemini联合评判的提示词遵循度等),但模型在奖励值0.65左右陷入平台期,生成的图片始终是单调的五瓣花剪贴画。诊断后发现,其中5个质量评判信号彼此相关性高达0.85-0.95,相当于同一标准重复测量五次。修复方案将绝对打分改为两两对比:裁判只需回答“两张图中哪张更像优质水彩画”,并引入117张人工精选的“喜爱”级图片作为参照池。新方案让模型训练提速三倍,生成的代码长度从13,500个token压缩至2,000以下,且画面表现力持续提升。

为什么重要

这个项目回应了生成式AI领域一个被长期搁置的深层问题:当奖励不可自动验证时,如何对创意任务做强化学习?数学题有标准答案,游戏有胜负,但美学质量无法用0到1的分数简单衡量。Surya的实验显示,“评分”本身就是错误的问题表述——人类更擅长做相对判断(哪个更好)而非绝对判断(打几分)。将奖励信号从绝对打分改为两两对比,直接打开了模型的动态学习空间。

此外,“代码即作品”的思路为图像生成开辟了一条不同的技术路径:当前主流的扩散模型(如Midjourney、Stable Diffusion)将用户锁定在提示词交互的单一模式中,任何局部修改都需重新生成。而代码生成让图像从“一次性产物”变成“可修改的源文件”,像素级的调整不再依赖完整重跑。

对用户/开发者/创作者的影响

对开发者和创作者:这一方法暗示着一种新的AI绘画工作流——你拿到的是一段可读、可改的代码,而不是一张不可拆解的PNG。后续若该技术产品化,插画师、设计师可以像调整CSS样式一样微调画面局部:改一笔颜色、调一处构图,而不是反复输入提示词碰运气。这降低了AI绘画的“不可控感”。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对AI训练研究者:该项目提供了一套可复用的奖励设计框架。其核心教训是:在构建RLHF或RL训练管线时,信号的相关性比信号数量更关键。多个高度相关的评判器不会提供更多信息,反而可能引入偏差。两两对比配合人工标注参照池,是低成本获得高质量奖励信号的有效路径。

值得关注的后续

目前公开信息显示,这一项目尚处于学术实验阶段,作者本人也未完成“用标注数据训练独立奖励模型”的最后一步——那才是更完整的RLHF闭环。后续值得观察三个方向:

一是该训练管线是否会被封装为标准工具或开源组件,供其他创作者微调自己的绘图模型;二是代码生成图像的质量能否从水彩花卉等单一题材扩展至更复杂的场景,其奖励参照池的建设成本是否会成为规模化瓶颈;三是这一“相对判断”奖励机制能否迁移到其他创意领域,如UI设计、视频生成或3D建模,如果可行,它可能成为创意型RL训练的标准范式。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 19877

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注