一句话看懂:Hugging Face Papers 收录的论文显示,从零预训练的 3B 像素空间文生图模型 Iris-3B 在 1024² 文生图上可对标潜空间模型,但在深度估计和超分等下游任务上,像素空间先验并未带来显著优势。
事件核心:发生了什么
2026 年 10 月 7 日,一篇题为 Iris-3B 的论文在 Hugging Face Papers 公开。作者从零预训练了一个 30 亿参数的像素空间文本到图像 Transformer,采用 256→512→1024 的课程学习,并先在 256² 上消融预测目标和表示对齐以决定扩展方向。团队还尝试把已预训练的潜空间模型 FLUX.2 Klein base 4B 转换到像素空间。随后他们用同一条直接回归配方,把这两类模型微调到单目深度估计和图像恢复/超分任务上,结果没有发现像素空间生成先验带来显著提升。
为什么重要
潜空间扩散依赖 VAE 压缩图像,会损失细粒度细节,因此业界一直有观点认为像素空间模型在细节敏感的下游任务上更有优势。这篇论文用对照实验检验了这一假设:在深度估计上,Iris-3B 与潜空间 FLUX.2 Klein 打平,转换版像素模型反而落后;在 4 倍 DIV2K 超分上,两个像素模型都没有超过潜空间微调版。这给“像素空间必然更强”的判断提供了一个负面证据,也说明像素空间路线的价值目前更多体现在生成质量而非下游迁移。同时,Iris-3B 证明 PixelDiT 的 PiT 头可以扩展到 3B 参数,并宣称在 1024² 下 OneIG 官方评测与 Qwen-Image 持平。
对用户/开发者/创作者的影响
目前公开信息显示,作者已放出权重和训练代码,开发者可以直接复用像素空间预训练流程,而不必只依赖潜空间方案。对做超分、深度估计等下游任务的团队来说,论文的负面结论意味着选择像素空间主干时,需要先在自己的数据和任务上验证收益,不能默认它一定优于潜空间微调。对创作者和图像生成应用而言,Iris-3B 仍是一个研究性质的开源模型,是否能在实际产品里替代主流潜空间模型,还要看推理成本、显存占用和生态工具的适配情况;论文摘要并未给出这些工程指标的完整对比。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Iris-3B 的权重和训练代码被更广泛复现后,能否在更多任务上复现 OneIG 的持平结论;第二,像素空间模型的推理效率和显存开销是否接近潜空间方案,这决定它能否进入实际部署;第三,FLUX.2 Klein 转换到像素空间后落后的原因是否在后续工作中被修正,以及社区是否会围绕 PiT 头形成新的开源训练栈。


