La NASA e IBM lanzan un modelo fundacional lunar de código abierto entrenado con 17 años de datos de la Luna
La NASA e IBM han presentado un modelo fundacional multimodal de código abierto para la ciencia lunar, entrenado con casi dos millones de paquetes de datos a lo largo de 17 años de observaciones orbitales para mapear cráteres y localizar hielo polar.

La NASA e IBM Research, junto con varias instituciones académicas, han presentado el NASA-IBM Lunar Foundation Model. Diseñado como un sistema de inteligencia artificial de código abierto para la ciencia planetaria, el modelo transforma 17 años de registros en bruto de orbitadores lunares en una herramienta adaptable para mapear cráteres, analizar la geología de la superficie y localizar posibles reservas de hielo de agua.
Los datos de observación procedentes de misiones espaciales son abundantes, pero los ejemplos etiquetados por humanos son escasos y requieren mucho trabajo para producirse. En lugar de depender de algoritmos diseñados para tareas específicas y entrenados para una sola aplicación, este modelo fundacional se preentrena con volúmenes masivos de datos no etiquetados. Posteriormente, los investigadores pueden ajustarlo para objetivos específicos de ciencia lunar utilizando una cantidad mínima de muestras etiquetadas.
Entrenamiento con SomBench: 17 años y cuatro misiones
El modelo fue entrenado desde cero utilizando SomBench, que los investigadores describen como el mayor corpus lunar multimodal y coregistrado recopilado hasta la fecha. El conjunto de datos incluye casi 2 millones de paquetes de teselas a través de 11 modalidades y dos escalas espaciales:
- Aproximadamente 1 millón de imágenes de alta resolución capturadas por la Narrow Angle Camera (NAC) a cerca de 1 metro por píxel.
- Casi 964.000 imágenes multiespectrales de la Wide Angle Camera (WAC) a 100 metros por píxel.
- Más de 30 capas de datos alineadas espacialmente procedentes de nueve instrumentos científicos en cuatro misiones, incluidos datos gravitatorios de GRAIL, distribución de hidrógeno de Lunar Prospector y mediciones mineralógicas de la sonda Kaguya/SELENE de JAXA.
La mayor parte de los datos de entrenamiento proviene de 17 años de observaciones del Lunar Reconnaissance Orbiter (LRO) de la NASA, una misión que ha generado más datos en bruto que todas las demás misiones planetarias de la NASA combinadas. Para evitar la fuga de datos durante el entrenamiento y la evaluación, el equipo de investigación dividió el corpus geográficamente por zonas cartográficas en lugar de mezclar al azar las teselas de imágenes.
Geometría explícita y visión multiescala
En cuanto a su arquitectura, el modelo lunar se basa en TerraMind, un modelo de observación terrestre desarrollado por IBM en 2025 en colaboración con la Agencia Espacial Europea (ESA) y el Forschungszentrum Jülich. Sin embargo, en lugar de ajustar el modelo terrestre, el equipo entrenó la red lunar desde cero.
Un desafío clave en la Luna es que los ángulos de iluminación y la longitud de las sombras alteran drásticamente la apariencia de la superficie, eclipsando a menudo las verdaderas propiedades físicas del terreno. Para solucionar esto, el modelo recibe la geometría explícita de las imágenes —incluidos los ángulos de iluminación, la posición solar y los límites de las teselas— como entrada contextual junto con los datos de imagen y elevación.
La arquitectura divide las imágenes lunares, las capas de elevación y los datos geométricos en tókenes y aprende sus relaciones prediciendo secciones enmascaradas. Mediante una técnica llamada FlexiViT, el modelo aprende tanto de imágenes a escala gruesa como de alta resolución en un solo ciclo de entrenamiento, lo que le permite adaptarse a diferentes tamaños de parches de imagen sin necesidad de reentrenarse. También procesa cada modalidad de datos a través de vías dedicadas, evitando la limitación habitual de tratar las entradas de distintos sensores como simples canales superpuestos.
Superando a los modelos de referencia en la detección de hielo polar
El equipo de investigación evaluó el modelo en varios puntos de referencia científicos, incluyendo la detección de cráteres a resoluciones de 100 metros y de 1 metro, la segmentación de Irregular Mare Patches (formaciones volcánicas jóvenes que desafían las teorías sobre el enfriamiento lunar) y la predicción de depósitos de hielo polar.
Las regiones en sombra permanente de los polos lunares permanecen lo suficientemente frías como para atrapar hielo de agua durante miles de millones de años, lo que las convierte en objetivos críticos para la obtención de recursos prospectivos como agua potable, oxígeno respirable y propulsor para cohetes. En las predicciones de depósitos de hielo polar, el modelo fundacional lunar redujo el error de predicción hasta en un 22 por ciento en comparación con el modelo de referencia líder, SwinV2-B.
En la detección de cráteres a escala gruesa (100 metros), el modelo superó a SwinV2-B en casi un 19 por ciento utilizando solo la mitad de los datos de entrenamiento etiquetados. En la detección de cráteres a escala métrica y la segmentación de Irregular Mare Patches, el modelo tuvo un rendimiento comparable al de las mejores referencias, con un modesto margen del 3 por ciento reportado en los parches volcánicos. Los autores también descubrieron que el ajuste fino eficiente en parámetros mediante LoRA (Low-Rank Adaptation) igualó o superó el rendimiento del ajuste fino completo en la mayoría de las pruebas de referencia.
Análisis científico, no un sustituto geodésico
A pesar de sus capacidades analíticas, el modelo no está diseñado para el posicionamiento espacial exacto. En pruebas de evaluación generativa, las coordenadas de latitud y longitud predichas por el modelo se desviaron decenas de grados en ciertos casos, y el terreno reconstruido ocasionalmente mostró valores de altura absoluta desplazados, a pesar de mantener formas morfológicas correctas.
El director de IBM Research Europe, Juan Bernabé-Moreno, señaló que el valor principal del modelo radica en conectar lecturas de diversos instrumentos para descubrir patrones invisibles en conjuntos de datos aislados, enfatizando que sirve como una base analítica y no como un sustituto de mediciones físicas directas.
El modelo lunar amplía la iniciativa en curso "AI for Science", establecida entre la NASA e IBM bajo un Space Act Agreement a principios de 2022. Esta colaboración dio como fruto previamente el modelo de observación terrestre Prithvi en agosto de 2023 para el mapeo de inundaciones e incendios forestales.
El NASA-IBM Lunar Foundation Model, junto con sus conjuntos de datos de preentrenamiento y suites de evaluación, se ha puesto a disposición del público en Hugging Face, con el código fuente publicado en GitHub e integrado en el kit de herramientas de código abierto TerraTorch.



