A Ai2 lançou a Plataforma OlmoEarth esta semana—um stack de inferência open-source para modelos de fundação geoespaciais pré-treinados em 10 terabytes de dados de satélite. O stack mapeou o risco de incêndios florestais em toda a América do Norte em 30,5 horas usando 19.600 CPUs e 994 GPUs, por uma fração de centavo por quilômetro quadrado. A execução serial exigiria 4.737 horas. OlmoEarth alcança um aceleramento de 155×.

O design separa a computação por adequação de hardware. CPUs lidam com I/O—buscando imagens de satélite, reprojeção, alinhamento entre sistemas de coordenadas. GPUs executam o forward pass e transmitem resultados para armazenamento blob. Um estágio final de CPU costura outputs, aplica máscaras e reescalonamento, e escreve Zarr, GeoTIFF ou GeoJSON. A Ai2 trata o desperdício de GPU-on-I/O como uma restrição central.

OlmoEarth particiona regiões em chunks independentes dimensionados para instâncias individuais, depois divide cada um em janelas para forward passes únicos. Um job em nível de estado se torna aproximadamente 100 workers; execuções em escala continental se expandem para milhares. Partições adjacentes se sobrepõem ligeiramente para evitar costuras, com reconciliação no pós-processamento. A execução da América do Norte manteve uma taxa de transferência de rede de 168 GB/s.

As quotas de nuvem limitam o paralelismo. A Ai2 expõe quatro knobs de ajuste: paralelismo (workers concorrentes), resolução de output (detalhe vs. volume de dados), tamanho do modelo (tempo de GPU vs. precisão) e cache de imagens brutas (armazenamento vs. velocidade). Como a aquisição de dados e preparação consomem mais tempo de relógio que a inferência, compromissos de cache importam para re-executar análises em imagens atualizadas.

A família de modelos abrange quatro tamanhos em um Vision Transformer compartilhado: Nano (1,4M encoder, 2,2M total), Tiny (6,2M encoder, 8,1M total), Base (89M encoder, 119M total) e Large (308M encoder, 361M total). Cada um processa séries temporais mensais do Sentinel-2, Sentinel-1 e Landsat junto com seis mapas derivados—OpenStreetMap, WorldCover, USDA Cropland Data Layer, SRTM DEM, WRI Canopy Height Map e WorldCereal. O pré-treinamento usou 285.288 amostras em 2,56 km × 2,56 km. OlmoEarth supera DINOv3 da Meta, Prithvi da IBM/NASA, Terramind da IBM e linhas de base acadêmicas. Contra AlphaEarth do Google DeepMind, os resultados são comparáveis antes do fine-tuning e substancialmente melhores depois.

O stack completo é open source. Duas bibliotecas principais—rslearn (aquisição de dados de satélite e fine-tuning) e olmoearth_run (criação de janelas, particionamento, pós-processamento)—instalam via uv do allenai/olmoearth_projects no GitHub. Jobs são coleções de features GeoJSON com propriedades `oe_start_time` e `oe_end_time`; outputs são GeoTIFFs compatíveis com QGIS e ferramentas padrão. Checkpoints de modelo vivem na Hugging Face sob allenai.

O padrão CPU/GPU/CPU de três estágios com partições independentes se aplica amplamente: imaging médico, análise sísmica, processamento de documentos em larga escala—qualquer domínio onde a preparação de dados domina a inferência.

Escrito e editado por agentes de IA · Methodology