NASA 和 IBM 的开源月球模型,把 17 年的轨道器数据变成月球科学研究的基础

NASA 与 IBM 联合发布开源月球基础模型,把 17 年月球轨道器观测数据整合成可供机器学习使用的语料库,在极区冰沉积预测和高分辨率陨石坑检测上超过多个基线模型。

一句话看懂:NASA 与 IBM 联合发布开源月球基础模型,把 17 年月球轨道器观测数据整合成可供机器学习使用的语料库,在极区冰沉积预测和高分辨率陨石坑检测上超过多个基线模型。

事件核心:发生了什么

NASA 和 IBM Research 联合多家学术机构发布了 NASA-IBM Lunar Foundation Model,双方称其为最早的开源月球科学基础模型之一。模型并非微调,而是基于多模态地球观测模型 TerraMind 架构从零训练。

训练语料 SomBench 被团队称为目前规模最大的共配准多模态月球语料库,包含近 200 万个 tile bundle,覆盖 11 种模态、两个空间尺度:约 100 万张来自窄角相机的高分辨率图像(约 1 米/像素),以及近 96.4 万张广角相机多光谱图像(100 米/像素)。数据主体是月球勘测轨道器 17 年观测成果,NASA 称其数据量超过其他所有行星任务总和,另整合了 GRAIL 重力、Lunar Prospector 氢元素和 JAXA 辉夜号矿物学数据,共 30 多个空间对齐数据层。

为防止训练、验证、测试数据泄漏,语料按地图区域地理切分,而非随机分配 tile。模型把光照几何(照明角度、太阳位置、tile 范围)作为显式输入,而不是让模型从像素中自行猜测。

为什么重要

月球观测数据丰富,但标注稀缺。基础模型的思路是先在海量无标注数据上预训练,再用少量标注样本适配具体任务,这正好对上月球科研的痛点。

成绩上,极区冰沉积预测的误差比最佳基线 SwinV2-B 最多降低 22%;粗尺度陨石坑检测在只用一半训练数据的情况下领先近 19%,说明所需标注样本更少。目前公开信息显示,即使随机初始化的对照模型也在 7 个基线中的 5 个上胜出,部分优势来自模型的数据处理方式本身。这一路线若成立,将降低行星科学对昂贵标注的依赖,也可能推动更多机构跟进开源科学基础模型。

对用户/开发者/创作者的影响

对科研开发者,开源意味着可以直接下载权重与语料接口,用于陨石坑检测、不规则月海斑块分割等下游任务,而不必从零训练视觉模型。对 AI 工程侧,值得研究的是它把成像几何作为显式上下文、用 FlexiViT 让同一模型适配不同图像 patch 尺寸、以及高低分辨率混合训练的做法,这些技巧可迁移到遥感、地图和其他多模态推理场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是模型权重和 SomBench 的完整开放程度与许可条款。二是社区能否基于它做出冰资源勘探等实际任务的可复现结果。三是这类“科学基础模型”是否会扩展到火星等其他行星数据,形成新的开源生态。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 27238

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注