Arena 提出偏好+评分标准后训练,FLUX.2-dev 冲上 T2I 榜单第二

Arena 公布一种将人类偏好与显式评分标准奖励结合的后训练方法,用约 500 万对偏好投票训练奖励模型,使 FLUX.2-dev 在其实时文生图榜单上升至第 2 名,Ideogram 4 得分达到 1224。

一句话看懂:Arena 公布一种将人类偏好与显式评分标准奖励结合的后训练方法,用约 500 万对偏好投票训练奖励模型,使 FLUX.2-dev 在其实时文生图榜单上升至第 2 名,Ideogram 4 得分达到 1224。

事件核心:发生了什么

2026 年 10 月 2 日,Arena 发布研究文章,提出一种面向文生图模型的后训练方案:把人类偏好信号与基于评分标准的奖励结合起来。具体做法是,先用约 500 万对来自 Text-to-Image Arena 的人类偏好投票训练 Bradley-Terry 奖励模型,再借助视觉语言模型自动生成针对每个提示词的结构化检查清单,评估图像是否遵循提示词、满足约束,并规避训练中出现的奖励破解行为。

根据原文,后训练后的 FLUX.2-dev 在 Arena 实时 T2I 榜单上获得 69 个 Arena 点数的提升,位列第 2;Ideogram 4 则达到 1224 分,并在 2026 年 9 月 4 日的榜单条件下超过所有公开列出的开源模型。需要说明的是,这些结果限定于原文给出的评测日期和 Arena 榜单条件,并非永久排名。

为什么重要

文生图模型的开源前沿最近在 RL 后训练上进展有限,关键难点在于“优化什么奖励”。单纯依赖人类偏好,容易让模型生成视觉上讨喜但偏离提示词、添加未请求元素或忽略风格的图像;单纯依赖规则检查,又难以覆盖开放创作中的隐性约束。

Arena 的思路是把偏好奖励与自动评分标准奖励组合起来,为扩散模型的 RL 后训练提供更细粒度的信号。如果这一路线可复现,它可能成为开源文生图模型缩小与闭源模型差距的实用方法,也会影响开发者选择后训练框架和奖励模型的生态。

对用户/开发者/创作者的影响

对开发者而言,这提示了一条可参考的后训练路径:偏好数据负责整体审美和构图,自动评分标准负责提示词遵循和约束检查,两者互补。但原文目前只披露了方法框架和部分评测结果,尚未说明是否开放代码、模型权重或 API,也未见同行评审信息,落地成本仍待观察。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者来说,如果这类后训练被集成到开源模型和生成工具中,可能意味着图像更贴合提示词、更少出现“好看但跑题”的结果。不过短期影响取决于模型是否真正开源发布,以及推理算力要求是否可接受。

值得关注的后续

一是 Arena 是否公开奖励模型、训练代码或完整论文细节;二是 FLUX.2-dev 和 Ideogram 4 的后训练版本是否可被开发者实际调用;三是其他开源文生图项目是否跟进类似“偏好加评分标准”的奖励组合。目前公开信息显示,相关结果仍来自 Arena 自身评测,第三方复现和长期排名变化尚不明确。

来源:Arena

celebrityanime
celebrityanime
文章: 28008

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注