一句话看懂:Zatom-2 是一个在约 500 万个分子与材料结构上预训练的原子级生成模型,尝试用同一套架构覆盖化学、材料与生物蛋白场景,并在低数据量蛋白设计中报告了可复现的提升。
事件核心:发生了什么
alphaXiv 页面显示,论文于 2026 年 10 月 8 日发布,作者团队提出 Zatom-2,一个基于多尺度 Transformer 与条件流匹配(conditional flow matching)的原子级生成模型。训练数据来自 OMol25 和 OMat24 电子结构数据集,规模约 500 万个结构,并采用面向化学与生物数据的 atom1+atom14 分词方案,支持力条件、结构预测以及分子与材料能量和力的预测。
作者在 X 上的推文称,Zatom-2 的分子分布保真度优于 Zatom-1,在现有分子和材料生成基准上表现较强;通过联合生成-预测预训练和迁移学习,在 2000 个蛋白结构域上微调后,长度外推设置下的蛋白骨架可设计性从无预训练的 67.8% 提升至 74.8%。社区评论与作者结论需区分看待,上述结果目前来自论文摘要与作者公开说明。
为什么重要
原子级生成模型长期按学科分裂:化学模型围绕小分子,材料模型围绕晶体,生物模型围绕蛋白,彼此数据难复用。Zatom-2 的价值在于用统一的前沿模型架构和分词方案,把数据丰富的有机/无机结构数据与数据稀缺的生物场景连接起来,这为“一个底座模型服务多学科发现”提供了可讨论的技术路线。如果这条路可行,药物发现、电池材料筛选和蛋白工程可能共享预训练与微调流程,降低每个领域的冷启动成本。
但需注意,目前公开信息显示这是论文层面的研究,并非已上线产品,也没有第三方复现或同行评审结论。其基准提升限定在特定任务、数据规模与评测条件下,不能理解为永久排名。
对用户/开发者/创作者的影响
对 AI for Science 开发者而言,Zatom-2 提示了一个方向:多任务预训练目标(生成、结构预测、能量与力预测)可以打包进同一模型权重,配合力条件进行可控采样。若后续开源代码与权重,分子材料团队可能减少从零训练生成模型的需求,把精力放在领域数据微调与评估上。对生物信息团队,低数据量蛋白设计的报告结果意味着迁移学习可能比从头训练更实用,但 2000 个结构域的微调设置与实际湿实验验证之间仍有距离。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业和投资方,值得关注的是这类统一原子模型是否会成为 AI 制药和材料研发平台的底层组件,以及算力与数据飞轮由谁掌握。对内容创作者,这一方向的技术解读需求会上升,但应避免把论文结果包装成产品发布。
值得关注的后续
一是 Zatom-2 是否公开代码、权重与推理接口,这决定开发者能否实际使用;二是蛋白骨架可设计性等指标能否在独立评测和实验验证中复现;三是分子与材料生成基准上是否有竞品跟进统一预训练路线,以及低力/高力条件生成的控制能力是否扩展到更多体系。
来源:alphaXiv


