O OlmoEarth Studio da Allen AI agora exporta vetores de embedding diretamente de seus modelos geoespaciais de fundação de código aberto, dando às equipes de ML uma camada de representação compacta e reutilizável para dados de satélite e clima sem a necessidade de montar um pipeline de inferência completo. Código fonte, pesos do modelo e um relatório técnico foram lançados em 12 de agosto de 2026. Os embeddings chegam como Cloud-Optimized GeoTIFFs (COGs), prontos para serem plugados em qualquer tarefa downstream: busca por similaridade, segmentação, detecção de mudanças ou clustering não supervisionado.
Três variantes de encoder cobrem o trade-off compute-accuracy: Nano com 128 dimensões e 1.4M parâmetros, Tiny com 192 dimensões e 6.2M parâmetros, e Base com 768 dimensões e 89M parâmetros. Cada execução é parametrizada por área de interesse (qualquer polígono), intervalo de tempo (1 a 12 períodos mensais), resolução espacial (10m, 20m, 40m, ou 80m por pixel), e fonte de imagens (Sentinel-2 L2A, Sentinel-1 RTC, ou ambas). Os embeddings são computados sob demanda em vez de serem extraídos de um arquivo global em cache. Granularidade mensal é suportada — dinâmicas sazonais são capturadas, não suavizadas em compostas anuais.
O armazenamento é int8: inteiros com sinal de 8 bits variando de -127 a +127, com -128 como sentinel de nodata. Vetores em ponto flutuante são recuperados via `dequantize_embeddings` no pacote `olmoearth_pretrain`. Essa quantização mantém tamanhos de arquivo COG gerenciáveis ao exportar sobre grandes áreas de interesse.
Em um teste de segmentação de cobertura de terra com poucos exemplos sobre Ca Mau, Vietnã, uma região costeira de mangues, embeddings Tiny com resolução de 40m e compostas Sentinel-2 L2A anuais alcançaram um F1 ponderado de 0.84 com apenas 60 pixels rotulados (20 por classe: mangue, água, outro). Aumentar dados de treinamento rotulados de 30 para 300 pixels mal moveu a acurácia. As representações fazem o trabalho de discriminação antes do classificador ver um rótulo. A análise requer uma leitura rasterio, um reshape de array, e um pipeline sklearn — nenhuma GPU necessária na inferência.
A estrutura global de embedding foi validada em 1.1M amostras de imagens Sentinel-2 sazonais. Quinze clusters de k-means em um espaço de embedding reduzido por PCA alinham-se coerentemente com tipo de superfície. Em busca por similaridade, um pixel de query próximo a Merced, CA retorna um mapa de calor de similaridade de cosseno onde tecido urbano e corredores de estradas pontuam alto e parcelas agrícolas pontuam baixo — com zero dados de treinamento. O modelo aprendeu geometria de superfície suficiente do pré-treinamento para que um produto escalar manipule a recuperação.
O lançamento não inclui um arquivo de embedding global pré-computado. Cada execução é cobrada por compute. Para equipes que precisam de cobertura wall-to-wall em escala global, esse custo sobe rápido — especialmente com resolução de 10m com Base (89M params). Allen AI oferece fine-tuning supervisionado (SFT) no Studio para equipes com dados rotulados, mas o acesso é restrito; contacte-os diretamente.
Para equipes de plataforma ML construindo pipelines geoespaciais, comece com Tiny com 40m para exploração e tarefas de similaridade, depois promova para Base com resolução mais fina apenas quando held-out eval F1 justificar o delta de compute. O formato int8 COG integra-se limamente com ferramentas raster padrão — rasterio, GDAL, xarray — então nenhuma dependência de runtime nova é necessária. O risco arquitetural principal é vendor lock-in ao OlmoEarth Studio para computação sob demanda. Pesos públicos permitem auto-hospedagem, mas a API Studio manipula tiling e aquisição de imagens automaticamente — não trivial de replicar por conta própria.