OlmoEarth Studio de Allen AI ahora exporta vectores de embedding directamente desde sus modelos geoespaciales de fundación de código abierto, proporcionando a los equipos de ML una capa de representación compacta y reutilizable para datos de satélite y clima sin necesidad de montar un pipeline de inferencia completo. El código fuente, pesos del modelo y un reporte técnico se lanzaron el 12 de agosto de 2026. Los embeddings llegan como Cloud-Optimized GeoTIFFs (COGs), listos para conectarse a cualquier tarea downstream: búsqueda de similitud, segmentación, detección de cambios o clustering no supervisado.

Tres variantes de encoder cubren el trade-off compute-accuracy: Nano con 128 dimensiones y 1.4M parámetros, Tiny con 192 dimensiones y 6.2M parámetros, y Base con 768 dimensiones y 89M parámetros. Cada ejecución se parametriza por área de interés (cualquier polígono), intervalo temporal (1 a 12 períodos mensuales), resolución espacial (10m, 20m, 40m, u 80m por píxel), y fuente de imágenes (Sentinel-2 L2A, Sentinel-1 RTC, o ambas). Los embeddings se computan bajo demanda en lugar de extraerse de un archivo global en caché. Se soporta granularidad mensual — la dinámica estacional se captura, no se promedian en composites anuales.

El almacenamiento es int8: enteros con signo de 8 bits que van de -127 a +127, con -128 como sentinel de nodata. Los vectores en punto flotante se recuperan vía `dequantize_embeddings` en el paquete `olmoearth_pretrain`. Esa cuantificación mantiene los tamaños de archivo COG manejables al exportar sobre grandes áreas de interés.

En una prueba de segmentación de cobertura terrestre con pocos ejemplos sobre Ca Mau, Vietnam, una región costera de manglares, embeddings Tiny con resolución de 40m y composites Sentinel-2 L2A anuales lograron un F1 ponderado de 0.84 con apenas 60 píxeles etiquetados (20 por clase: manglar, agua, otro). Aumentar datos de entrenamiento etiquetados de 30 a 300 píxeles apenas movió la precisión. Las representaciones hacen el trabajo de discriminación antes de que el clasificador vea una etiqueta. El análisis requiere una lectura rasterio, un reshape de array, y un pipeline sklearn — ninguna GPU necesaria en inferencia.

La estructura global de embedding fue validada en 1.1M muestras de imágenes Sentinel-2 estacionales. Quince clusters de k-means en un espacio de embedding reducido por PCA se alinean coherentemente con tipo de superficie. En búsqueda de similitud, un píxel de consulta cerca de Merced, CA devuelve un mapa de calor de similitud de coseno donde el tejido urbano y corredores de carreteras puntúan alto y parcelas agrícolas puntúan bajo — sin datos de entrenamiento. El modelo aprendió suficiente geometría de superficie del pre-entrenamiento para que un producto punto maneje la recuperación.

El lanzamiento no incluye un archivo de embedding global pre-computado. Cada ejecución se factura por compute. Para equipos que necesitan cobertura wall-to-wall a escala global, ese costo se suma rápidamente — especialmente con resolución de 10m con Base (89M params). Allen AI ofrece fine-tuning supervisado (SFT) en Studio para equipos con datos etiquetados, pero el acceso está limitado; contáctelos directamente.

Para equipos de plataforma ML construyendo pipelines geoespaciales, comienza con Tiny a 40m para exploración y tareas de similitud, luego promueve a Base con resolución más fina solo cuando held-out eval F1 justifique el delta de compute. El formato int8 COG se integra limpiamente con herramientas raster estándar — rasterio, GDAL, xarray — por lo que ninguna nueva dependencia de runtime es necesaria. El riesgo arquitectónico principal es vendor lock-in a OlmoEarth Studio para computación bajo demanda. Los pesos públicos te permiten auto-hospedarse, pero la API Studio maneja tiling y adquisición de imágenes automáticamente — no trivial replicar por tu cuenta.