一句话看懂:Google DeepMind 发布了 AlphaGenome Atlas,一个覆盖人类基因组中约 90 亿种单碱基变化的预测数据库,旨在帮研究人员从海量基因变异中快速筛出可能致病的少数,而非逐个做实验验证。
事件核心:发生了什么
9 月 9 日,Google DeepMind 公开了 AlphaGenome Atlas 数据集。该数据集基于 2025 年推出的 AI 模型 AlphaGenome 构建,对约 90 亿种可能的单碱基替换逐一给出预测值。人类基因组约含 30 亿个 DNA 字母,平均每个人携带数百万处微小变异,判断其中哪些与疾病相关几乎不可能通过实验逐一验证,这正是该数据库想填补的空白。
Atlas 的预测不止停留在一个“有害/无害”标签上:每个变异平均附带约 27,000 个预测值,覆盖基因表达强度、调控蛋白结合、转录剪接改变等,并细化到数百种细胞类型与组织中的影响。整个数据集体量达 1 PB,是 AlphaFold 蛋白质结构数据库的 30 倍以上。为便于普通研究者使用,团队同时推出 AlphaGenome Variant Impact Score(AVI),用一个小型神经网络把数千个数值压缩成一个 0 到 1 之间的评分,该模型仅依赖 18 个输入特征,远少于主流基准工具 CADD 的 150 多个特征。
值得留意的是,绝大多数变异目前并没有确切的临床致病结论作为训练标签。团队采用间接策略:把人群中极罕见的变异视为可能有害、常见变异视为可能无害。尽管训练信号是间接的,论文显示 AVI 在已临床分类变异上的测试表现优于现有工具,尤其在非编码区域优势更明显。
为什么重要
人类基因组中约 98% 的区域不编码蛋白质,这些非编码区更像“开关”和“旋钮”,决定基因在哪些组织、什么时机被激活。大多数与疾病相关的变异恰恰位于这些区域,其作用机制此前极难解读。AlphaGenome Atlas 把 AI 预测从“逐条查询”变为“预计算全量检索”,相当于把此前不可行的全基因组规模调控效应扫描变成了可查询的公开资源。
从行业格局看,这延续了 DeepMind 从 AlphaFold(蛋白质结构)向“基因组功能解读”延伸的路径,且数据库体量大幅超过前者。另一个值得注意的细节是 AVI 刻意保持轻量化:18 个输入特征即可达到或超越依赖 150 多个特征的 CADD,说明 AI 方法在特征工程上的效率优势正变得可量化,这对同类生物信息学工具是一个直接的竞争信号。
对用户/开发者/创作者的影响
对遗传病研究人员和临床诊断团队,Atlas 的价值体现在优先级排序。素材中提及的一个实际案例显示:一名严重癫痫患儿在基因组测序后长期未获诊断,AVI 将一个此前定为“意义未明”的 DNM1 基因变异推至候选列表前列,AlphaGenome 预测还给出了具体机制——该变异在脑内表达的转录本中制造了异常剪接位点,使蛋白延长 13 个氨基酸;实验室实验验证了该预测,研究者建议将其归类为“可能致病”。在回顾性测试中,AVI 在 29.5% 的已解决病例里把致病变异排入前 50 候选,CADD 仅为 12.5%。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对研究群体遗传学的开发者和数据分析师,Atlas 提供了新的分组维度。英国埃克塞特大学的 Gareth Hawkes 利用该数据库,把 UK Biobank 中 5.4 万人的基因组数据按“预测功能相似”而非单纯位置进行变异分组,找到的非编码变异与血液蛋白水平关联数量比传统筛选方法多出 22%。这说明该数据库可能让低频变异关联分析在统计功效上有切实提升。团队还从预测中提取了 2,601 个重复出现的短 DNA 基序,相当于调控蛋白结合位点的“基因组词汇表”,这对开发解释性分析工具有一定的参考价值。
值得关注的后续
一、公开访问方式和计算成本:1 PB 的数据集对普通实验室的本地部署几乎不可能,Web 查询界面和 API 的响应策略将直接影响实际采用范围。
二、临床转化的节奏与门槛:AVI 评分目前尚不能单独作为诊断依据,但如果后续在更大规模未确诊罕见病队列中复现类似 DNM1 案例的成功率,可能推动临床级评分标准的讨论。
三、模型已知局限的补全路径:DeepMind 方面承认 AlphaGenome 未能覆盖所有细胞类型,且遗漏了部分调控机制。目前公开信息显示,数据库尚不包含结构变异和多碱基插入缺失,后续是否扩展到这些变异类型值得跟踪。


