Inference engine open-source default pra serving LLM — PagedAttention + continuous batching.
Padrão de fato pra self-hosting de open-weights em GPU. Throughput líder via PagedAttention. Suporta speculative decoding, prefix caching, quantizações (AWQ/GPTQ/FP8). Comunidade enorme, releases regulares. Stack default que recomendo pra qualquer time montando inference on-prem.