A NVIDIA está lançando o Nemotron 3.5 Lightning, um modelo mixture-of-experts com 30 bilhões de parâmetros para execução de tarefas especializadas em alto volume em sistemas multi-agentes, e o NeMo Switchyard, uma biblioteca de roteamento de código aberto que despacha solicitações entre conjuntos de modelos. Ambos lançam imediatamente: Lightning está disponível no Hugging Face, ModelScope, OpenRouter e build.nvidia.com como um microserviço NVIDIA NIM. Switchyard é código aberto.
Lightning fica abaixo de planejadores de fronteira como Nemotron Ultra ou GPT-5.6 — lidando com revisão de código, invocação de ferramentas, triagem de alertas de segurança e consultas de faturamento, em vez de orquestração de alto nível. A NVIDIA afirma 4x velocidade de saída mais rápida e conclusão de tarefas de agentes 30% mais rápida em relação a modelos concorrentes, segundo benchmarks PinchBench. A arquitetura MoE mantém parâmetros ativos baixos enquanto mantém capacidade total de 30B. O pós-treinamento integra-se com NVIDIA NeMo para customização de domínio. A NVIDIA também está lançando o Nemotron-RL-Agentic-Terminal-Pivot, o conjunto de dados de aprendizado por reforço usado para ajustar Lightning para cargas de trabalho de agentes de codificação, publicado junto com os pesos para rastreabilidade.
O NeMo Switchyard resolve o imposto de roteamento. Em implantações de modelo único, cada chamada atinge o mesmo endpoint independentemente da complexidade da tarefa. Em stacks roteadas manualmente, engenheiros mantêm lógica de despacho por pipeline que quebra quando modelos mudam. O Switchyard conecta-se a frameworks de agentes existentes e roteia prompts automaticamente com base em prioridades configuráveis: qualidade, latência ou custo. O benchmark interno da NVIDIA coloca o custo de conclusão de tarefas no nível do sistema em aproximadamente um terço de uma execução Opus 4.8 sozinha em qualidade de fronteira, embora a comparação misture tarefas elegíveis para roteamento com chamadas mais simples, então as economias dependem da distribuição de tráfego.
Os resultados dos primeiros parceiros mostram impacto em produção. A Boomi relatou precisão de roteamento por domínio de 100% em cinco capacidades, redirecionando 59% do tráfego para um modelo ajustado que executa 5x mais rápido do que a linha de base, reduzindo a latência de turno posterior em 21%. A Ramp executou Switchyard em sua variante SWE-Bench interna e igualou o desempenho de modelo de fronteira enquanto reduzia custos em 58% e tempo de execução em 33%. A Cadence viu ganhos de eficiência de 9,9% em cargas de trabalho de verificação formal usando o ChipStack AI Super Agent. Essas execuções abrangem ferramentas de integração, engenharia de software e EDA — limitando ceticismo típico de benchmark único.
A história de implantação do Lightning é ampla por design. Os alvo locais incluem PCs NVIDIA RTX, DGX Spark, DGX Station e Jetson. As implantações corporativas cobrem estações de trabalho RTX PRO, data centers locais e nuvem. A CrowdStrike ajustou-o para cibersegurança, Harvey com Trajectory para serviços jurídicos, CodeRabbit com Baseten para revisão de código, Lila Sciences para raciocínio de ciências da vida e Fastino Labs para desenvolvimento de software, finanças e saúde — todos relatando ganhos de precisão por domínio após ajuste fino em conjuntos de dados proprietários via NeMo.
O custo operacional do Switchyard é real. Ele requer um catálogo de modelos e regras de roteamento. Conectar-se ao LangGraph ou CrewAI sem reescrever a lógica da aplicação é o objetivo, mas a qualidade do roteamento se degrada se o catálogo estiver desatualizado ou os limites de domínio forem mal especificados. A precisão de roteamento de 100% da NVIDIA da Boomi se aplica a uma taxonomia de cinco capacidades; gráficos de agentes em produção normalmente têm decomposições de tarefas mais bagunçadas. O ganho de eficiência de 9,9% da Cadence em verificação formal é modesto em relação ao corte de custo de 58% da Ramp — o spread sugere que as economias dependem da carga de trabalho.
Para arquitetos: Lightning é um sub-agente auto-hospedado credível para tarefas de alto volume e sensíveis a latência onde custos de API por token são a restrição. O valor do Switchyard cresce com a profundidade do catálogo — mais modelos e variantes ajustadas habilitam melhor otimização. Pesos abertos e dados de treinamento publicados tornam ambos defensáveis para implantações de indústria regulada. Comece estreito: um NIM Lightning atrás de uma rota Switchyard para uma única tarefa de alto volume, meça delta de latência e custo, depois expanda.