Modelos y plataformas de IA
IBM y NASA publican modelo de base lunar de código abierto con el conjunto de datos SomBench

IBM y NASA, el 10 de septiembre de 2026, anunciaron la publicación de código abierto del NASA-IBM Lunar Foundation Model, un modelo de base multimodal y multiresolución para la teledetección lunar, junto con SomBench, el conjunto de datos lunar co‑registrado creado para entrenarlo.
En el anuncio, con fecha de Yorktown Heights, Nueva York, IBM describió el sistema como uno de los primeros modelos de base disponibles públicamente para la exploración científica de la Luna, entrenado con un extenso conjunto de datos de observaciones lunares curado por investigadores de IBM y NASA. Los pesos del modelo se publican en Hugging Face bajo la licencia Apache-2.0, con el código de ajuste fino mantenido en un repositorio de GitHub de NASA-IMPACT y la adaptación posterior gestionada a través de TerraTorch. La tarjeta del modelo presenta el lanzamiento como una representación reutilizable para la teledetección lunar: ajuste fino o adaptación LoRA del codificador para detección, segmentación y regresión densa en imágenes LROC y productos de terreno co‑registrados, con subconjuntos de modalidades y cuadrículas de parches que pueden diferir del preentrenamiento.
Según el anuncio, los investigadores podrían aplicar el modelo a varias áreas de estudio lunar: predecir dónde podría haber hielo en regiones permanentemente sombreadas, que son difíciles de observar pero podrían contener recursos considerados esenciales para una futura base lunar; cartografiar Irregular Mare Patches, características volcánicas que los científicos estudian para comprender la historia volcánica y la evolución térmica de la Luna; y detectar, contextualizar y clasificar cráteres, trabajo que revela pistas sobre la edad del terreno y la geología y ayuda a la NASA a seleccionar sitios de aterrizaje seguros mientras se evitan peligros como pendientes pronunciadas y rocas.
“La NASA ha pasado décadas construyendo un extraordinario registro científico de la Luna, pero la recopilación de datos es solo una parte del trabajo”, dijo Kevin Murphy, director de datos científicos y director interino de datos e IA en la sede de la NASA, añadiendo que el modelo muestra lo que es posible cuando la IA se aplica a los petabytes de datos científicos de la NASA.
IBM afirmó que el modelo amplía una colaboración establecida entre ambas organizaciones y se une a la familia Prithvi de modelos de base abiertos disponibles en Hugging Face, que abarca geoespacial, meteorología, heliofísica y ahora la Luna. El anuncio presenta la publicación abierta como una visión más amplia en la que los investigadores parten de un modelo compartido y lo adaptan a nuevas tareas en lugar de crear un nuevo sistema algorítmico para cada pregunta científica.
Juan Bernabe-Moreno, Director de IBM Research Europe, Reino Unido e Irlanda, dijo que el modelo brinda a los científicos una base para explorar la Luna a gran escala, conectando observaciones de diferentes instrumentos, revelando patrones que son difíciles de ver de forma aislada, y “proporcionando una plataforma abierta sobre la que la comunidad investigadora global puede construir”.
Arquitectura y Preentrenamiento
La tarjeta del modelo describe un codificador‑decodificador ViT‑B (768 dimensiones, 12 capas, 12 cabezas de atención) entrenado desde cero en SomBench: aproximadamente 2 millones de paquetes de teselas lunares co‑registradas que abarcan 11 modalidades en dos escalas espaciales, imágenes de la Cámara de Ángulo Angosto (NAC) de LROC a aproximadamente 1 metro por píxel y imágenes de la Cámara de Ángulo Ancho (WAC) a aproximadamente 100 metros por píxel. El sistema adapta la receta de token enmascarado de TerraMind con dos extensiones. La geometría de adquisición por tesela, incluidos los ángulos de iluminación, anclajes en el marco solar y la huella de la tesela, se tokeniza como entradas explícitas del codificador; los autores afirman que la apariencia de la superficie lunar está gobernada más por la geometría de iluminación que por la variación intrínseca de la superficie. Las teselas ancladas en NAC y WAC también se entrenan juntas en un único bucle de lote mixto a resolución nativa, de modo que un conjunto de pesos cubre ambas familias de resolución a través de una brecha de escala de 100×.
Las entradas abarcan nueve capas densas similares a imágenes más dos modalidades de contexto tipo secuencia: metadatos ópticos por tesela con ocho campos y contexto de mapa estático con 28 campos extraídos de los productos Diviner, LOLA, Mini‑RF, Kaguya, WAC, GRAIL y Lunar Prospector. Una incrustación de parches FlexiViT permite que el punto de control se ajuste fino a otros tamaños de parche sin volver a entrenar la columna vertebral, y la tokenización por modalidad permite que las modalidades se eliminen o añadan durante el ajuste fino. El preentrenamiento se ejecutó en 16 GPU H100 durante 150 000 pasos con un lote global de 1 536 en bf16, totalizando aproximadamente 1 100 horas de GPU, utilizando nueve tokenizadores VQ‑VAE específicos de modalidad con cuantización FSQ, un decodificador DDPM y un objetivo de entropía cruzada sobre vocabularios de tokens discretos.
Resultados de Referencia Reportados
IBM afirmó que el modelo supera a los métodos ampliamente utilizados en hasta un 23 % al identificar características geográficas clave en la superficie lunar, incluidos posibles depósitos de hielo, cráteres y formaciones volcánicas. Citando un documento técnico NASA‑IBM, la empresa informó que el modelo redujo el error (RMSE) en hasta un 22 % en comparación con el modelo SwinV2‑B (ImageNet) al identificar áreas con alto potencial de hielo lunar; capturó la extensión de los Irregular Mare Patches un 3 % mejor que SwinV2‑B mientras utilizaba etiquetas imperfectas; y igualó a modelos de última generación como SwinV2‑B en la detección de cráteres a escala de metros, superándolo en casi un 19 % a una escala de contexto de aproximadamente 100 metros usando la mitad de los datos de entrenamiento.
La tabla de referencia en la tarjeta del modelo informa un RMSE de prospectividad de hielo polar de 0,0293 con ajuste fino completo, frente a 0,0377 para la mejor línea base (SwinV2‑B) y 0,0397 para un control de inicialización aleatoria, e identifica la prospectividad de hielo como la mayor diferencia. Para la segmentación de Irregular Mare Patch informa un IoU1 de 0,5709 frente a 0,5687 para ConvNeXtV2‑B, y para la detección del cráter Robbins en imágenes WAC un mAP de 0,2581 usando LoRA frente a 0,2420 para SwinV2‑B; la tarjeta indica que las variantes preentrenadas con el 50 % de los datos de entrenamiento ya igualan o superan a SwinV2‑B entrenado con el conjunto completo. Los autores advierten que los líderes en los puntos de referencia de cráteres NAC y de Irregular Mare Patch deben considerarse comparables porque las diferencias son menores que la variabilidad entre semillas. Las pruebas se ejecutaron a través de TerraTorch con cargadores, divisiones, aumentaciones, pérdida y métricas mantenidas fijas entre los backbones, con líneas base que incluyen ResNet‑50, ViT‑B MAE, ConvNeXt‑B, ConvNeXt‑V2‑B, SwinV2‑B, DaViT‑B, DeepLabV3+ y SegFormer, reportadas como media y desviación estándar sobre cinco semillas.
Corpus SomBench y Limitaciones Declaradas
IBM afirmó que sus científicos, trabajando con NASA, construyeron el primer conjunto de datos lunar de código abierto de su tipo, agregando más de 30 capas alineadas espacialmente de nueve instrumentos a través de cuatro misiones, incluidas la Lunar Reconnaissance Orbiter y la misión GRAIL de NASA y la SELENE/Kaguya de la Agencia Japonesa de Exploración Aeroespacial. La tarjeta del conjunto de datos SomBench describe dos trazas: WACLowRes, 963,609 teselas que cubren 51,2 kilómetros a 100 metros por píxel extraídas de 54,080 registros de datos de experimentos de Cámara de Ángulo Ancho y que suman 38 TB; y NACHighRes, 1,000,113 teselas que cubren 512 metros a 1 metro por píxel de 1,095 registros de Cámara de Ángulo Angosto, totalizando 1,4 TB. El corpus se publica bajo una licencia CC BY 4.0, con el conjunto de datos completo alojado en AWS. Las divisiones se asignan a nivel de zona del Mercator Transversal Lunar con un objetivo de 75/15/10, las teselas que abarcan dos zonas se descartan para evitar fugas espaciales, y la división de prueba se reserva para la evaluación posterior.
La tarjeta del modelo indica que el sistema no es un producto generativo de grado científico, no mantiene un marco de referencia geodésico y no está validado para decisiones operativas como la certificación de sitios de aterrizaje o la eliminación de peligros; también señala que las salidas de prospectividad de hielo regresan un mapa difuso impulsado por conocimiento en lugar de hielo medido. Las limitaciones enumeradas incluyen contribuciones de ablación que aún no se han aislado y el preentrenamiento NAC restringido a 1 095 marcos co‑registrados, mientras que la tarjeta del conjunto de datos menciona una resolución espacial heterogénea y una incertidumbre de geolocalización absoluta de decenas de metros. El trabajo fue apoyado por la NASA bajo el Award No. 80MSFC25M0084.












