NVIDIA está lanzando Nemotron 3.5 Lightning, un modelo mixture-of-experts con 30 mil millones de parámetros para ejecución de tareas especializadas de alto volumen en sistemas multiagentes, y NeMo Switchyard, una biblioteca de enrutamiento de código abierto que envía solicitudes a través de conjuntos de modelos. Ambos se lanzan inmediatamente: Lightning está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com como un microservicio NVIDIA NIM. Switchyard es código abierto.

Lightning se ubica por debajo de planificadores fronterizos como Nemotron Ultra o GPT-5.6 — manejando revisión de código, invocación de herramientas, clasificación de alertas de seguridad y consultas de facturación en lugar de orquestración de alto nivel. NVIDIA afirma una velocidad de salida 4x más rápida y finalización de tareas de agentes 30% más rápida frente a modelos competidores, según puntos de referencia PinchBench. La arquitectura MoE mantiene los parámetros activos bajos mientras mantiene una capacidad total de 30B. El entrenamiento posterior se integra con NVIDIA NeMo para personalización de dominio. NVIDIA también está lanzando Nemotron-RL-Agentic-Terminal-Pivot, el conjunto de datos de aprendizaje por refuerzo utilizado para ajustar Lightning para cargas de trabajo de agentes de codificación, publicado junto con los pesos para trazabilidad.

NeMo Switchyard resuelve el impuesto de enrutamiento. En implementaciones de modelo único, cada llamada toca el mismo punto final independientemente de la complejidad de la tarea. En pilas enrutadas manualmente, los ingenieros mantienen lógica de envío por canalización que se rompe cuando cambian los modelos. Switchyard se conecta a marcos de agentes existentes y enruta automáticamente indicaciones basadas en prioridades configurables: calidad, latencia o costo. El punto de referencia interno de NVIDIA coloca el costo de finalización de tareas a nivel del sistema en aproximadamente un tercio de una ejecución Opus 4.8 sola en calidad fronteriza, aunque la comparación mezcla tareas elegibles para enrutamiento con llamadas más simples, por lo que los ahorros dependen de la distribución del tráfico.

Los resultados de los primeros socios muestran impacto en producción. Boomi informó una precisión de enrutamiento de dominio del 100% en cinco capacidades, redirigiendo el 59% del tráfego a un modelo ajustado que se ejecuta 5x más rápido que la línea de base, reduciendo la latencia de turno posterior en un 21%. Ramp ejecutó Switchyard en su variante SWE-Bench interna y coincidió con el desempeño del modelo fronterizo mientras reducía costos en un 58% y el tiempo de ejecución en un 33%. Cadence vio ganancias de eficiencia del 9,9% en cargas de trabajo de verificación formal utilizando el Agente Super ChipStack AI. Estas ejecuciones abarcan herramientas de integración, ingeniería de software y EDA — limitando el escepticismo típico de punto de referencia único.

La historia de implementación de Lightning es ampla por diseño. Los objetivos locales incluyen PC NVIDIA RTX, DGX Spark, DGX Station y Jetson. Las implementaciones empresariales abarcan estaciones de trabajo RTX PRO, centros de datos locales y nube. CrowdStrike lo ajustó para ciberseguridad, Harvey con Trajectory para servicios legales, CodeRabbit con Baseten para revisión de código, Lila Sciences para razonamiento de ciencias de la vida y Fastino Labs para desarrollo de software, finanzas y salud — todos reportando ganancias de precisión de dominio después del ajuste fino en conjuntos de datos propietarios a través de NeMo.

El costo operativo de Switchyard es real. Requiere un catálogo de modelos y reglas de enrutamiento. Conectarse a LangGraph o CrewAI sin reescribir la lógica de la aplicación es el objetivo, pero la calidad del enrutamiento se degrada si el catálogo está desactualizado o los límites de dominio están mal especificados. La precisión de enrutamiento del 100% de NVIDIA de Boomi se aplica a una taxonomía de cinco capacidades; los gráficos de agentes de producción generalmente tienen descomposiciones de tareas más desordenadas. La ganancia de eficiencia del 9,9% de Cadence en verificación formal es modesta en comparación con la reducción de costos del 58% de Ramp — la dispersión sugiere que los ahorros dependen de la carga de trabajo.

Para arquitectos: Lightning es un subagente autohospedado creíble para tareas de alto volumen sensibles a la latencia donde los costos de API por token son la restricción. El valor de Switchyard crece con la profundidad del catálogo — más modelos y variantes ajustadas permiten una mejor optimización. Los pesos abiertos y los datos de entrenamiento publicados hacen que ambos sean defendibles para implementaciones de industrias reguladas. Comience de manera limitada: un NIM Lightning detrás de una ruta Switchyard para una sola tarea de alto volumen, mida la delta de latencia y costo, luego expanda.