Jev, o padrão de inferência que dominou AI Twitter por meses, se reduz a uma operação direta: carregar um modelo, construir um prompt com escolhas rotuladas, extrair logits de tokens para essas escolhas e convertê-los em probabilidades. Um post no blog de Duarte O. Carmo no NobodyWho demonstra a pilha completa em 25 linhas de Python, usando Qwen3-0.6B rodando localmente via llama-cpp-python.

A implementação carrega um modelo GGUF quantizado do Hugging Face, tokeniza um prompt que apresenta ao modelo opções discretas e então extrai logits brutos do token final do modelo. O passo crítico é isolar logits apenas para os tokens correspondentes aos rótulos das escolhas—no exemplo, os caracteres únicos "A", "B" e "C"—em vez de computar probabilidades em todo o vocabulário. Esses logits são então normalizados usando log-sum-exp para produzir probabilidades calibradas.

O exemplo classifica um email como legítimo, spam ou phishing. Depois que o modelo processa o prompt, o código recupera logits para os três tokens de rótulo, converte-os em log-probabilidades e exponencia para obter as probabilidades finais. A saída mostra que o modelo atribuiu probabilidade 0.885 a phishing, 0.084 a spam e 0.031 a legítimo. Os valores intermediários—logits brutos de 26.254, 27.262 e 29.614 para as três classes—também são impressos, mostrando os scores não normalizados antes da conversão de probabilidade.

A pilha requer Python 3.12 ou posterior, huggingface-hub, llama-cpp-python e numpy. O modelo roda com uma janela de contexto de 512 tokens e logits_all definido como true, o que força o mecanismo de inferência a computar logits para cada posição de token, não apenas a final. O post não relata latência, throughput ou footprint de memória para o modelo Qwen3-0.6B em nenhum hardware, então os custos operacionais permanecem não especificados.

O autor enquadra isso como uma paródia, observando que o post é uma abordagem simplificada de Jev e direcionando leitores para três implementações abertas mais completas: OpenJev, openjev-sglang e OpenJev no DiffusionGemma. O post do NobodyWho não afirma ser a versão autoritária ou pronta para produção, e não discute como lidar com casos em que o token principal do modelo para um rótulo de escolha não é o rótulo em si, ou como escalar esse padrão para conjuntos de escolhas maiores ou descrições de opções mais longas.

O aprendizado para arquitetos é que classificação de escolhas via extração de logits é implementável em código mínimo e roda inteiramente localmente, mas implantações em produção precisam medir latência e memória no hardware alvo, lidar com casos extremos em que o alinhamento de tokens falha e decidir se as probabilidades de um modelo pequeno são calibradas o suficiente para a tarefa downstream.