9月19日、RuntimeWire.comが「NASA and IBM released an open lunar AI model trained on two million data bundles」と題した記事を公開した。この記事では、NASAとIBMが月面探査向けにオープンなAI基盤モデルを共同開発・公開したこと、およびその裏側にある地道なデータ整備作業について詳しく紹介されている。以下に、その内容を紹介する。
NASAとIBMが月面AI基盤モデルを公開
9月10日、NASAとIBMは「NASA-IBM Lunar Foundation Model」をオープンソースで公開した。クレーターのマッピング、火山地形の分析、月極域の氷の探索といった惑星科学タスクへの活用を想定している。
モデルはゼロから学習されており、学習データは約200万件の地理的分割データバンドル、モダリティ数は11種類に上る。具体的にはカメラ画像・地形データ・レーダー・鉱物学・重力・照明ジオメトリなど、複数ミッションにわたる異種センサーの観測データを統合している。
モデルの重みはHugging Faceで公開され、ファインチューニング・推論コードはGitHubにApache-2.0ライセンスで提供されている。
最大の課題は「データの不統一」だった
宇宙×AIという組み合わせで語られがちなこのモデルだが、技術的に最も興味深いのはアーキテクチャよりもデータ整備の困難さにある。
NASAが長年にわたって蓄積してきた月の観測データは、解像度が1メートルから20キロメートル/ピクセルまで混在し、座標系・カバレッジ・測定規約もバラバラだ。モデルにデータを流し込むだけなら難しくないが、物理的に意味のある関係性を学習させるには地質学的な判断が不可欠になる。
この問題に対応したのが、惑星科学者のRachel Slank(USRA・NASAマーシャル宇宙飛行センター所属)だ。彼女はアーカンソー大学で宇宙・惑星科学の博士号を取得し、月面の溶岩チューブや空洞の研究などを手がけてきた専門家である。モデル開発チームでは、科学的知見と機械学習パイプラインの橋渡し役を担い、データの入力設計・評価方法・アプリケーション定義に関与した。
4万9千以上のクレーターを手作業でラベリング
Slankが主導した評価データセット「**SomBench」の構築作業は、規模感が際立っている。月面偵察衛星(Lunar Reconnaissance Orbiter)のナローアングルカメラ画像をベースに、4万9,000個以上のクレーターを手動で特定・アノテーション**し、対応する地形モデルと紐付けた。
モデルのプレトレーニングに要したGPU計算量は約1,100 H100 GPU時間(モデルカードより)。しかしその評価が成立するためには、科学者が数万件のクレーター境界を事前に引いておく必要があった。「ゼロから事前学習」という一言が隠している作業量を象徴するエピソードだ。
照明条件をモデルの明示的な入力として扱う
月面画像特有の課題として、影が地形変化よりも支配的に見える問題がある。このモデルでは、太陽角度やタイル座標などの取得ジオメトリ情報をモデルへの明示的な入力として与えており、モデル自身に推論させる設計は取っていない。
また、広角カメラ(約100メートル/ピクセル)とナローアングルカメラ(約1メートル/ピクセル)の100倍の解像度差を、単一の重みセットで処理する設計も技術的な見どころだ。
ベンチマーク結果と限界の明示
技術論文(9月8日公開のarXivプレプリント)によると、評価はクレーター検出・不規則な海(mare)パッチのセグメンテーション・月極域氷の探索可能性推定の3タスクで実施された。
主な結果は以下の通りだ:
- 極域氷の探索可能性推定でSwinV2-Bベースラインと比較して誤差を最大22%削減
- 広域クレーター検出では学習データを半分に抑えつつ約19%の性能向上
- メートルスケールのクレーター検出では最強ベースライン相当
ただし、これらの数値はプロジェクトチーム自身によるプレプリントの値であり、査読済み検証は未実施だ。モデルカードも率直に限界を記述しており、「生成されるフィールドは較正済みの科学的予測ではない」「位置推定は数十度ずれる可能性がある」「着陸地点の認定や危険除去への使用は検証されていない」と明記している。
再現性には注意が必要
GitHubリポジトリにはプレトレーニングコードは含まれていない。チェックポイントの検査・下流タスクの実験再現・アプリケーション構築は可能だが、モデル構築プロセス全体の完全な再現はできない。用途としてのオープン性と、プレトレーニング過程の再現性は切り離して理解する必要がある。
このモデルはIBMがNASAと進めてきた地理空間・気象・太陽物理学モデルの取り組みを月面に拡張したものとして位置付けられている。個別ミッション向けに作られた観測データを、将来の研究課題に対する共有インフラとして再利用可能にする構想の一環だ。
詳細はNASA and IBM released an open lunar AI model trained on two million data bundlesを参照していただきたい。




