aiexpert
Inicio / Radar / vLLM
Adopt · Inferencia

vLLM

Inference engine open-source default pra serving LLM — PagedAttention + continuous batching.

inferenceopen-sourcegpu

Por qué este anillo

Usar en producción sin dudar.

Padrão de fato pra self-hosting de open-weights em GPU. Throughput líder via PagedAttention. Suporta speculative decoding, prefix caching, quantizações (AWQ/GPTQ/FP8). Comunidade enorme, releases regulares. Stack default que recomendo pra qualquer time montando inference on-prem.

Evidencia citada

Las fuentes que sostienen la decisión
01 Canonical homepage github.com · 18 may 2026