NVIDIA — máxima performance em hardware NVIDIA, mas configuração e build process complexos.
Pico de throughput por GPU lidera quando otimizado. Vale o esforço pra workloads de altíssima escala onde cada % de eficiência conta (custos de GPU dominam). Trade-off: build process traditional (.engine files, recompilação por modelo+config), porting de modelos novos demora vs vLLM. Adoption fora dos hyperscalers ainda restrita.