NASA e IBM lançam modelo de fundação lunar de código aberto treinado com 17 anos de dados da Lua
A NASA e a IBM apresentaram um modelo de fundação multimodal de código aberto para a ciência lunar, treinado com quase dois milhões de pacotes de dados obtidos ao longo de 17 anos de observações orbitais para mapear crateras e localizar gelo polar.

A NASA e a IBM Research, em conjunto com várias instituições acadêmicas, revelaram o NASA-IBM Lunar Foundation Model. Projetado como um sistema de inteligência artificial de código aberto voltado para a ciência planetária, o modelo transforma 17 anos de registros brutos de orbitadores lunares em uma ferramenta adaptável para mapear crateras, analisar a geologia da superfície e localizar potenciais reservas de gelo de água.
Dados de observação de missões espaciais são abundantes, mas exemplos rotulados por humanos são raros e exigem muito trabalho para serem produzidos. Em vez de depender de algoritmos dedicados a tarefas únicas, este modelo de fundação realiza o pré-treinamento em volumes massivos de dados não rotulados. Posteriormente, os pesquisadores podem ajustá-lo para objetivos específicos da ciência lunar usando um número mínimo de amostras rotuladas.
Treinamento no SomBench: 17 anos e quatro missões
O modelo foi treinado do zero usando o SomBench, que os pesquisadores descrevem como o maior corpus lunar multimodal e corregistrado já reunido até hoje. O conjunto de dados conta com quase 2 milhões de pacotes de blocos (tile bundles) distribuídos em 11 modalidades e duas escalas espaciais:
- Aproximadamente 1 milhão de imagens em alta resolução capturadas pela Narrow Angle Camera (NAC) a cerca de 1 metro por pixel.
- Quase 964.000 imagens multiespectrais da Wide Angle Camera (WAC) a 100 metros por pixel.
- Mais de 30 camadas de dados espacialmente alinhadas, provenientes de nove instrumentos científicos em quatro missões, incluindo dados de gravidade da GRAIL, distribuição de hidrogênio da Lunar Prospector e medições mineralógicas da sonda Kaguya/SELENE, da JAXA.
A maior parte dos dados de treinamento provém de 17 anos de observações da Lunar Reconnaissance Orbiter (LRO) da NASA — uma missão que gerou mais dados brutos do que todas as outras missões planetárias da agência somadas. Para evitar o vazamento de dados (data leakage) durante o treinamento e a avaliação, a equipe de pesquisa dividiu o corpus geograficamente por zonas no mapa, em vez de embaralhar aleatoriamente os blocos de imagens.
Geometria explícita e visão multiescala
Em termos de arquitetura, o modelo lunar é baseado no TerraMind, um modelo de observação da Terra que a IBM desenvolveu em 2025 em colaboração com a Agência Espacial Europeia (ESA) e o Forschungszentrum Jülich. Em vez de fazer o ajuste fino do modelo terrestre, no entanto, a equipe treinou a rede lunar do zero.
Um dos principais desafios na Lua é que os ângulos de iluminação e o comprimento das sombras alteram drasticamente a aparência da superfície, muitas vezes se sobrepondo às verdadeiras propriedades físicas do terreno. Para contornar isso, o modelo recebe a geometria explícita de captura de imagem — incluindo ângulos de iluminação, posição do Sol e limites dos blocos — como entrada contextual, juntamente com as imagens e os dados de elevação.
A arquitetura divide as imagens lunares, as camadas de elevação e os dados geométricos em tokens e aprende suas relações prevendo seções mascaradas. Usando uma técnica chamada FlexiViT, o modelo aprende tanto com imagens de escala ampla quanto de alta resolução em um único ciclo de treinamento, permitindo que ele se ajuste a diferentes tamanhos de blocos (patches) de imagem sem a necessidade de retreinamento. O sistema também processa cada modalidade de dados distinta por meio de caminhos dedicados, evitando a limitação comum de tratar entradas de diferentes sensores como simples canais empilhados.
Superando baselines na detecção de gelo polar
A equipe de pesquisa avaliou o modelo em vários benchmarks científicos, incluindo a detecção de crateras em resoluções de 100 metros e 1 metro, a segmentação de Irregular Mare Patches (formações vulcânicas jovens que desafiam as teorias sobre o resfriamento lunar) e a previsão de depósitos de gelo polar.
Regiões permanentemente na sombra nos polos lunares permanecem frias o suficiente para reter gelo de água por bilhões de anos, tornando-se alvos críticos na busca por recursos prospectivos como água potável, oxigênio respirável e propelente de foguetes. Nas previsões de depósitos de gelo polar, o modelo de fundação lunar reduziu o erro de previsão em até 22% em comparação com a principal referência, a SwinV2-B.
Na detecção de crateras em escala ampla (100 metros), o modelo superou a SwinV2-B em quase 19%, utilizando apenas metade dos dados de treinamento rotulados. Na detecção de crateras em escala métrica e na segmentação de Irregular Mare Patches, o modelo teve desempenho comparável aos melhores concorrentes, com uma margem modesta de 3% registrada nas formações vulcânicas. Os autores também constataram que o ajuste fino eficiente de parâmetros via LoRA (Low-Rank Adaptation) igualou ou superou o desempenho do ajuste fino completo na maioria dos benchmarks.
Análise científica, não substituição geodésica
Apesar de suas capacidades analíticas, o modelo não foi projetado para posicionamento espacial exato. Em testes de avaliação generativa, as coordenadas de latitude e longitude previstas pelo modelo desviaram dezenas de graus em determinados casos, e o terreno reconstruído ocasionalmente exibiu valores de altitude absoluta deslocados, embora tenha mantido as formas morfológicas corretas.
O diretor da IBM Research Europe, Juan Bernabé-Moreno, observou que o principal valor do modelo está em conectar leituras de diversos instrumentos para revelar padrões invisíveis em conjuntos de dados isolados, enfatizando que ele serve como uma base analítica, e não como substituto para medições físicas diretas.
O modelo lunar expande a iniciativa contínua "AI for Science", estabelecida entre a NASA e a IBM sob um Space Act Agreement no início de 2022. A colaboração já havia resultado no modelo de observação da Terra Prithvi, em agosto de 2023, voltado para o mapeamento de inundações e incêndios florestais.
O NASA-IBM Lunar Foundation Model, juntamente com seus conjuntos de dados de pré-treinamento e pacotes de benchmarks, foi disponibilizado publicamente no Hugging Face, com o código-fonte publicado no GitHub e integrado ao kit de ferramentas de código aberto TerraTorch.



