Inference engine focado em structured generation e workloads agentic com cache de prefix agressivo.
Ganhou tração rápido competindo direto com vLLM em workloads structured (JSON schema, constrained decoding). RadixAttention permite cache de prefix entre requests, ganho enorme em agentic com prompts longos e similares. Boa alternativa quando o workload é heavy em structured outputs.