aiexpert
Início / Radar / vLLM
Adopt · Inferência

vLLM

Inference engine open-source default pra serving LLM — PagedAttention + continuous batching.

inferenceopen-sourcegpu

Por que este anel

Use em produção sem hesitar.

Padrão de fato pra self-hosting de open-weights em GPU. Throughput líder via PagedAttention. Suporta speculative decoding, prefix caching, quantizações (AWQ/GPTQ/FP8). Comunidade enorme, releases regulares. Stack default que recomendo pra qualquer time montando inference on-prem.

Evidência citada

As fontes que sustentam a chamada
01 Canonical homepage github.com · 18 de mai. de 2026