QuadTok 四叉树视觉分词器:省约10% token,947M 模型 ImageNet 256 达 2.08 gFID

一篇新论文提出 QuadTok,用四叉树结构做视觉分词和自回归图像生成,在 ImageNet 上比固定 256-token 网格省约 10% token,并给出 947M 模型 2.08 gFID 的 256×256 生成结果。它值得关注的原因是:在不明显牺牲重建质量的前提下,把二维空间结构和一维序列建模更自…

一句话看懂:一篇新论文提出 QuadTok,用四叉树结构做视觉分词和自回归图像生成,在 ImageNet 上比固定 256-token 网格省约 10% token,并给出 947M 模型 2.08 gFID 的 256×256 生成结果。它值得关注的原因是:在不明显牺牲重建质量的前提下,把二维空间结构和一维序列建模更自然地结合起来。

事件核心:发生了什么

据 Hugging Face Papers 收录的论文摘要,QuadTok 是一个面向自回归图像生成的视觉分词框架。它没有沿用常见的 2D 网格或 1D token 序列,而是采用层级式四叉树结构:视觉复杂区域获得更多表示容量,颜色或纹理均匀的区域则以较粗分辨率表示。

摘要给出的关键数据包括:在 ImageNet 上训练的分词器相比固定 256-token 网格节省约 10% token;零样本迁移到 COCO 时节省约 9%,同时保持相近的重建保真度。在 ImageNet 256×256 基准上,一个 947M 参数的 GPT 风格生成模型取得 2.08 gFID;生成前给定四叉树拓扑,树结构本身带来的因果性可直接用于自回归生成。论文还提到,四叉树保留的强空间相关性使该生成器具备零样本空间控制图像生成能力。

为什么重要

当前图像生成的主流路线之一,是把图像编码成固定长度的 token 序列,再交给自回归大模型或扩散模型。固定网格简单、并行友好,但会在平坦区域浪费 token;一维序列则容易丢失明确的空间邻近关系。QuadTok 的思路是在两者之间找折中:用树结构动态分配 token 预算,同时让生成过程天然按树节点顺序推进。对行业而言,这意味着自回归图像生成在效率、空间可控性和模型规模之间可能多一条可验证的技术路线。开源代码地址已给出,但摘要并未说明是否已在大规模产品中落地。

对用户/开发者/创作者的影响

对开发者,QuadTok 的吸引力主要在 token 效率和空间控制:如果后续复现实验成立,处理高分辨率图像时可能降低推理算力开销,也为“指定区域生成/编辑”提供更直接的接口形态。对创作者,零样本空间控制若能在实际工具中稳定兑现,会减少反复重绘和局部修补的成本,但当前公开信息仅来自论文摘要,距离可用的 API、插件或消费级产品还有距离。对企业采购和算力规划者,这类分词压缩是否真能在训练和推理两端降低成本,需要等独立评测和工程实现验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,看 QuadTok 的代码仓库是否放出完整训练与推理流程,以及 2.08 gFID 能否被第三方在相同条件下复现。第二,看四叉树拓扑由谁决定、是否需要额外标注或预处理,这直接影响空间控制生成的易用性。第三,看固定网格路线的头部模型和闭源产品是否跟进类似动态分辨率或层级 token 方案,以及 token 节省能否转化为实际推理成本下降。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28475

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注