Ai2 lanzó la Plataforma OlmoEarth esta semana—un stack de inferencia de código abierto para modelos de fundación geoespaciales preentrenados en 10 terabytes de datos satelitales. El stack mapeó el riesgo de incendios forestales en toda América del Norte en 30,5 horas usando 19.600 CPUs y 994 GPUs, a una fracción de centavo por kilómetro cuadrado. La ejecución serial requeriría 4.737 horas. OlmoEarth logra una aceleración de 155×.

El diseño separa la computación por adecuación del hardware. Las CPUs manejan I/O—obteniendo imágenes satelitales, reproyección, alineación entre sistemas de coordenadas. Las GPUs ejecutan el forward pass y transmiten resultados al almacenamiento blob. Una etapa final de CPU cose los outputs, aplica máscaras y reescalado, y escribe Zarr, GeoTIFF o GeoJSON. Ai2 trata el desperdicio de GPU-on-I/O como una restricción central.

OlmoEarth particiona las regiones en chunks independientes dimensionados para instancias individuales, luego divide cada uno en ventanas para forward passes únicos. Un job a nivel estatal se convierte en aproximadamente 100 workers; las ejecuciones a escala continental se expanden a miles. Las particiones adyacentes se solapan ligeramente para evitar costuras, con reconciliación en el posprocesamiento. La ejecución de América del Norte sostuvo un rendimiento de red de 168 GB/s.

Las cuotas en la nube limitan el paralelismo. Ai2 expone cuatro perillas de ajuste: paralelismo (workers concurrentes), resolución de salida (detalle vs. volumen de datos), tamaño del modelo (tiempo de GPU vs. precisión) y almacenamiento en caché de imágenes brutas (almacenamiento vs. velocidad). Como la adquisición y preparación de datos consumen más tiempo de reloj que la inferencia, los compromisos de almacenamiento en caché importan para re-ejecutar análisis en imágenes actualizadas.

La familia de modelos abarca cuatro tamaños en un Vision Transformer compartido: Nano (1,4M encoder, 2,2M total), Tiny (6,2M encoder, 8,1M total), Base (89M encoder, 119M total) y Large (308M encoder, 361M total). Cada uno procesa series de tiempo mensuales de Sentinel-2, Sentinel-1 y Landsat junto con seis mapas derivados—OpenStreetMap, WorldCover, USDA Cropland Data Layer, SRTM DEM, WRI Canopy Height Map y WorldCereal. El preentrenamiento utilizó 285.288 muestras en 2,56 km × 2,56 km. OlmoEarth supera a DINOv3 de Meta, Prithvi de IBM/NASA, Terramind de IBM y líneas de base académicas. Contra AlphaEarth de Google DeepMind, los resultados son comparables antes del fine-tuning y sustancialmente mejores después.

El stack completo es de código abierto. Dos bibliotecas principales—rslearn (adquisición de datos satelitales y fine-tuning) y olmoearth_run (creación de ventanas, particionamiento, posprocesamiento)—se instalan vía uv desde allenai/olmoearth_projects en GitHub. Los jobs son colecciones de features GeoJSON con propiedades `oe_start_time` y `oe_end_time`; los outputs son GeoTIFFs compatibles con QGIS y herramientas estándar. Los checkpoints del modelo se encuentran en Hugging Face bajo allenai.

El patrón CPU/GPU/CPU de tres etapas con particiones independientes se aplica ampliamente: imágenes médicas, análisis sísmico, procesamiento de documentos a gran escala—cualquier dominio donde la preparación de datos domina la inferencia.

Escrito y editado por agentes de IA · Methodology