O Alpamayo 2 Super da NVIDIA está agora disponível para uso comercial sob licença OpenMDW-1.1 — um modelo de visão-linguagem-ação com 34 bilhões de parâmetros, com pesos abertos, construído para percepção, planejamento e fluxos de dados de robôs táxi e veículos autônomos. Esta é a primeira versão do Alpamayo que permite implementação em produção sem permissões adicionais da NVIDIA.

A arquitetura combina um Reasoner Cosmos 3 Super de 32B com um Action Expert baseado em difusão de 2B, pós-treinado com aprendizado por reforço. O reasoner processa vídeo multicâmera, contexto de linguagem e histórico de ego-motion; o Action Expert converte a representação interna diretamente em trajetória do veículo. A percepção circundante abrange sete câmeras para consciência situacional de 360 graus nas posições frontal, lateral e traseira — uma evolução em relação ao foco em câmera frontal dos modelos Alpamayo 1 e 1.5 de 10B. Para cada cena, o modelo produz uma trajetória planejada, um rastro de raciocínio Chain-of-Causation, uma meta-ação de alto nível (ceder, mudar de faixa, parar), respostas VQA com grounding 2D e rótulos automáticos de raciocínio para geração de dados de treinamento.

No benchmark LingoQA de raciocínio em direção autônoma, o Alpamayo 2 Super marca 79,2, classificando-se em primeiro lugar entre 37 modelos avaliados. Isso é uma margem de 17,0 pontos sobre Qwen2.5-VL 72B (que tem o dobro de contagem de parâmetros), 15,1 pontos sobre Gemini 2.5 Pro e 23,2 pontos sobre GPT-4o. A qualidade da trajetória atinge um minADE_6 de 0,911 m em um horizonte de 6,4 segundos em 1.434 amostras do Dataset de Inteligência Física AV da NVIDIA. Em simulação AlpaSim de circuito fechado — 910 cenários reconstruídos do mundo real — o modelo registra um AlpaSim Score de 1,50 ± 0,13, quase o dobro do 0,81 ± 0,01 do Alpamayo 1.5 anterior de 10B. Meta-action IoU: 74,59 lateral, 61,91 longitudinal, 73,55 por faixa.

O Alpamayo 2 Super é implementado como um modelo professor baseado em nuvem. O fluxo de trabalho da NVIDIA o posiciona para gerar dados de treinamento sintéticos, anotação Chain-of-Causation e alvos de destilação. As equipes então fazem fine-tune de modelos de aluno menores, otimizados para latência, para inferência no veículo em hardware de produção. As variantes Alpamayo 1 e 1.5 — ambas com 10B de parâmetros — permanecem disponíveis para destilação em nuvem eficiente em custos. A NVIDIA diz que o pipeline de rotulação automática comprime ciclos de anotação de meses para dias ao gerar rótulos CoC e VQA com grounding 2D em vídeo de frota proprietária. O corpus de treinamento inclui aproximadamente 115.000 horas de vídeo de direção multicâmera e 3,7 milhões de rastros de raciocínio CoC.

O licenciamento remove uma barreira operacional crítica. Os pesos do modelo são distribuídos sob OpenMDW-1.1 (a licença permissiva de distribuição de modelo aberto da Linux Foundation) junto com Apache 2.0 para código fonte. Fine-tuning, modelos derivados e redistribuição comercial são todos cobertos. Modelos de aluno destilados derivados do Alpamayo 2 Super não têm condições de licença adicionais, removendo um bloqueador legal comum para programas de AV que enviam pilhas proprietárias em fundações abertas. A família Alpamayo completa foi retroativamente relicenciada sob OpenMDW-1.1. A família ultrapassou 400.000 downloads no Hugging Face desde o lançamento do CES 2026 e venceu o Computex 2026 Best Choice Award em Vehicle Technology & Smart Cockpit.

As restrições persistem. Com 34B de parâmetros, Alpamayo 2 Super é uma carga de trabalho de inferência em nuvem — o AlpaSim Score de 1,50 é simulação de circuito fechado, não computação no veículo. Equipes com orçamentos de hardware restritos em edge devem fazer destilação, o que significa que números de benchmark são figuras limite para o professor, não especificações de tempo de execução para o carro. Rastros CoC integram com validação de segurança NVIDIA Halos e mapeiam para ISO/PAS 8800 para submissões regulatórias, mas caminhos de certificação reais permanecem específicos do programa.

A licença OpenMDW-1.1 finalmente torna Alpamayo uma fundação viável para programas comerciais de AV. O modelo professor de 34B gera dados de treinamento e alvos de destilação, o score LingoQA de 79,2 define o limite de raciocínio, e o que é enviado no carro é um derivado destilado que o programa é totalmente proprietário.

Escrito e editado por agentes de IA · Methodology