VIEScore2 用网格定位图像缺陷,SRCC 达 0.601 超过 Gemini-3-Flash

Hugging Face Papers 收录的论文提出 VIEScore2,把图像质量打分和缺陷位置放进同一个模型一次输出,在主要评测集上整体分数 SRCC 为 0.601,高于同等输入条件下 Gemini-3-Flash 的 0.491。

一句话看懂:Hugging Face Papers 收录的论文提出 VIEScore2,把图像质量打分和缺陷位置放进同一个模型一次输出,在主要评测集上整体分数 SRCC 为 0.601,高于同等输入条件下 Gemini-3-Flash 的 0.491。

事件核心:发生了什么

根据论文摘要(2026 年 10 月 1 日发布),VIEScore2 是一个面向图像生成和编辑任务的统一评估器,支持可选的参考条件图像。与只给出单一质量分数的传统评估方式不同,它把图像表示为 N×N 网格,在一次模型前向中同时预测质量分数和缺陷所在位置。其文本原生网格表示让异构空间监督有了统一接口,也便于直接验证后训练目标。训练数据约 3.8 万个样本,覆盖仅打分、仅定位和联合监督三类任务,横跨生成与编辑场景。作者先做监督微调,再用 GRPO 强化缺陷定位,奖励由单元格级 Dice 重叠、分数准确率和输出格式有效性组成,最后用无参数解析器把结构化预测转成可读解释。在主要评测套件上,其整体分数 SRCC 为 0.601,对比 Gemini-3-Flash 的 0.491;在缺陷定位的六项基准中,有三项按图像网格 IoU 超过通用 VLM 和专用空间评估器,五项进入前三,包括训练来源之外的数据集。

为什么重要

图像评估长期停在“打一个分”的阶段,分数高但没人知道好在哪、差在哪,对生成模型迭代和编辑工具验收都不够用。VIEScore2 把评估输出从标量扩展到可定位的空间解释,等于让评估器同时承担质检和归因。这对开源评估生态尤其关键:如果评估结果可复现、可验证,生成模型的训练奖励和编辑产品的质量门禁都能用同一套接口串联。摘要中对比 Gemini-3-Flash 的数据,说明专用评估器在匹配输入下可能优于通用 VLM 零样本方案,但该结论仅限论文报告的主要套件和特定评测条件,不能理解为永久排名。

对用户/开发者/创作者的影响

对开发者,网格化输出意味着评估结果可以直接映射到图像区域,便于接入自动化测试、数据筛选或强化学习奖励,而不必再人工看图定位问题。对创作者和编辑工具用户,评估反馈可能从“这张图 82 分”变成“左下角区域存在缺陷”,修图时更有指向性。对企业采购方,如果需要可审计、可解释的图像质量评估,这类统一评估器比黑盒分数更有集成价值。不过目前公开信息仅为论文摘要,未显示已上线产品、API 或开源权重,实际可用性和推理成本仍需等待全文和代码发布确认。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是训练代码、模型权重和评测脚本是否开源,这决定社区能否复现 0.601 的 SRCC 和定位结果。二是无参数解析器生成的解释在真实业务图像上是否稳定,格式有效性能否支撑自动化流水线。三是通用 VLM 和专用空间评估器的竞争会怎么走,如果 Gemini 等闭源模型后续加入空间定位能力,专用评估器的优势窗口可能收窄。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28138

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注