AI RACE— AI Race
New Models

NASA·IBM, 17년간 축적된 달 데이터 학습한 오픈소스 달 파운데이션 모델 공개

NASA와 IBM이 크레이터 지도 작성과 극지방 얼음 탐색을 위해 17년간의 궤도선 관측 데이터 약 200만 건을 학습한 달 과학용 오픈소스 멀티모달 파운데이션 모델을 공개했다.

2026. 10. 04. 17:10
NASA và IBM phát hành mô hình AI nền tảng nguồn mở về Mặt Trăng được huấn luyện trên 17 năm dữ liệu

NASA와 IBM Research는 여러 학술 기관과 협력해 ‘NASA-IBM Lunar Foundation Model’을 공개했다. 행성 과학을 위한 오픈소스 인공지능(AI) 시스템으로 설계된 이 모델은 17년간 축적된 달 궤도선 원시 관측 데이터를 크레이터 지도 제작, 표면 지질 분석, 잠재적 수빙(물 얼음) 매장지 탐색 등에 유연하게 활용 가능한 도구로 전환한다.

우주 탐사 미션을 통해 수집되는 관측 데이터는 방대하지만, 사람이 직접 라벨링한 데이터는 매우 드물고 제작하는 데 많은 노동력이 소요된다. 이 파운데이션 모델은 단일 용도로 훈련된 개별 태스크 전용 알고리즘에 의존하는 대신, 레이블이 지정되지 않은 방대한 데이터를 사전 학습한다. 이후 연구진은 최소한의 라벨링 데이터만으로도 다양한 하위 달 과학 연구 목표에 맞게 모델을 미세조정(파인튜닝)할 수 있다.

SomBench 기반 훈련: 17년의 역사와 4개 미션 데이터 집약

이 모델은 연구진이 현재까지 구축된 동일 공간 정렬(co-registered) 멀티모달 달 데이터 코퍼스 중 최대 규모라고 설명하는 ‘SomBench’를 활용해 밑바닥부터(from scratch) 훈련됐다. 해당 데이터셋은 11개 모달리티와 2가지 공간 해상도에 걸쳐 약 200만 개의 타일 번들로 구성되어 있다.

  • 픽셀당 약 1미터 해상도로 협각 카메라(NAC)가 촬영한 고해상도 이미지 약 100만 장.
  • 픽셀당 100미터 해상도로 광각 카메라(WAC)가 포착한 다중분광 이미지 약 96만 4,000장.
  • GRAIL의 중력 데이터, Lunar Prospector의 수소 분포, JAXA의 Kaguya/SELENE 탐사선이 측정한 광물학적 데이터를 포함하여 4개 미션의 9개 과학 장비에서 수집된 30개 이상의 공간 정렬 데이터 레이어.

훈련 데이터의 대부분은 NASA의 달 정찰 궤도선(LRO)이 지난 17년간 관측한 기록에서 비롯됐다. LRO는 NASA의 다른 모든 행성 탐사 미션을 합친 것보다 더 많은 원시 데이터를 생성해 온 미션이다. 연구팀은 훈련 및 평가 과정에서 데이터 누출을 방지하기 위해 이미지 타일을 무작위로 섞지 않고 지도 구역별로 지리적으로 분할했다.

명시적 기하학 정보와 멀티스케일 비전 아키텍처

아키텍처 측면에서 이 달 모델은 IBM이 유럽우주국(ESA) 및 Forschungszentrum Jülich와 협력하여 2025년에 개발한 지구 관측 모델 TerraMind를 기반으로 한다. 그러나 연구팀은 기존 지구 모델을 미세조정하는 대신, 달 전용 네트워크를 처음부터 새로 학습시켰다.

달 환경의 주요 난제 중 하나는 조명 각도와 그림자 길이에 따라 표면의 형태가 극적으로 변해 지형 본래의 물리적 특성을 가려버리기 쉽다는 점이다. 이를 해결하기 위해 모델은 이미지 및 고도 데이터와 함께 조명 각도, 태양 위치, 타일 경계와 같은 명시적인 촬영 기하학(imaging geometry) 정보를 맥락 입력으로 제공받는다.

이 아키텍처는 달 영상, 고도 레이어, 기하학 데이터를 토큰으로 분할하고, 마스킹된 영역을 예측하는 방식으로 상호 관계를 학습한다. 또한 FlexiViT 기법을 적용해 단 한 번의 훈련으로 저해상도 이미지와 고해상도 이미지를 동시에 학습할 수 있어, 재학습 없이도 다양한 크기의 이미지 패치에 적응할 수 있다. 아울러 서로 다른 센서 입력을 단순히 채널로 쌓아 올리는 기존의 한계를 극복하고, 개별 데이터 모달리티를 전용 경로를 통해 독립적으로 처리한다.

극지방 얼음 탐색에서 기존 기준 모델 능가

연구진은 100미터 및 1미터 해상도에서의 크레이터 탐지, 달의 냉각 이론에 의문을 제기하는 젊은 화산 지형인 Irregular Mare Patches 분할, 극지방 수빙 매장지 예측 등 여러 과학 벤치마크를 통해 모델을 평가했다.

달 극지방의 영구 음영 지역은 수십억 년 동안 물 얼음을 가둬둘 수 있을 만큼 온도가 낮아 식수, 호흡용 산소, 로켓 추진제 등의 주요 잠재 자원으로서 핵심 표적이 된다. 극지방 얼음 매장지 예측에서 이 달 파운데이션 모델은 주요 기준 모델인 SwinV2-B 대비 예측 오차를 최대 22% 줄였다.

100미터 해상도의 크레이터 탐지에서는 라벨링된 훈련 데이터를 절반만 사용하고도 SwinV2-B보다 약 19% 우수한 성능을 보였다. 1미터급 크레이터 탐지 및 Irregular Mare Patch 분할에서는 최고 수준의 기준 모델들과 대등한 성능을 기록했으며, 화산 지형 패치에서는 약 3% 앞서는 성과를 나타냈다. 연구진은 또한 LoRA(Low-Rank Adaptation)를 통한 매개변수 효율적 미세조정이 대부분의 벤치마크에서 전체 미세조정(Full Fine-Tuning)과 동등하거나 이를 능가하는 성능을 보인다는 점도 확인했다.

측지학적 대체가 아닌 과학적 분석 도구

뛰어난 분석 역량에도 불구하고, 이 모델은 정밀한 공간 측위를 목적으로 설계된 것은 아니다. 생성 평가 테스트에서 모델이 예측한 위도와 경도 좌표는 일부 사례에서 수십 도씩 벗어났으며, 복원된 지형은 올바른 형태학적 형상을 유지했음에도 절대 고도 수치에서 오차를 보이기도 했다.

IBM Research Europe 디렉터 Juan Bernabé-Moreno는 이 모델의 주요 가치가 서로 다른 관측 장비의 데이터를 연결하여 개별 데이터셋에서는 볼 수 없었던 패턴을 밝혀내는 데 있다고 언급하며, 직접적인 물리적 측정을 대체하는 것이 아니라 분석적 기반 역할을 수행한다는 점을 강조했다.

이번 달 모델은 2022년 초 Space Act Agreement에 따라 NASA와 IBM이 체결한 진행형 이니셔티브인 "AI for Science"를 확장한 결과물이다. 양측의 협력은 앞서 2023년 8월 홍수 및 산불 매핑을 위한 지구 관측 모델 Prithvi를 선보인 바 있다.

NASA-IBM Lunar Foundation Model은 사전 학습 데이터셋 및 벤치마크 제품군과 함께 Hugging Face에 공개되었으며, 소스 코드는 GitHub에 게시되고 오픈소스 툴킷인 TerraTorch에 통합되었다.

관련 기사