A Liquid AI lançou o LFM2.5-VL-DSpark, um drafter de decodificação especulativa para seu modelo de visão e linguagem LFM2.5-VL-3B, segundo a postagem da empresa no blog do Hugging Face. O drafter reduz a latência de decode em até 3.13x no dispositivo e 2.66x em uma GPU H100, com ganhos de ponta a ponta de até 2.62x e 2.27x, respectivamente, mantendo a qualidade das saídas inalterada, afirma a postagem.
O mecanismo segue a mesma receita que a Liquid AI usou para seus drafters LFM2.5-DSpark apenas de texto: o modelo de rascunho capta um conjunto fixo de estados ocultos do modelo-alvo em camadas determinadas e os utiliza como condição para propor um bloco de k tokens candidatos, que o modelo-alvo então verifica. O que faz a variante de visão funcionar sem um algoritmo de inferência separado é que os patches de imagem e os tokens de texto são projetados em uma representação compartilhada antes dessas camadas captadas, de modo que o drafter enxerga vetores de estados ocultos com dimensionalidade idêntica, independentemente da modalidade de entrada. A postagem da Liquid AI é explícita ao afirmar que a decodificação especulativa é exata: o modelo-alvo verifica cada token proposto, de modo que a saída greedy do pipeline acelerado equivale ao modelo-alvo rodando sozinho.
O próprio drafter é uma arquitetura simplificada apenas com atenção, com 4 camadas e um tamanho de bloco de 9, escolhido depois que a Liquid AI executou ablações com 3, 4 e 5 camadas, segundo a postagem. A composição de seus componentes, conforme listado no blog: uma pilha decodificadora de 193.0M de parâmetros, uma projeção de estados ocultos de 21.0M de parâmetros, uma cabeça Markov de 65.5M de parâmetros, e normas mais uma cabeça de confiança com 6.4k parâmetros, totalizando aproximadamente 279.5M — um aumento de 8.9% em relação à pegada do modelo-alvo de 3B. O treinamento durou 10 épocas sobre uma mistura de SFT de visão e linguagem ponderada para as cargas de trabalho de serviço esperadas pela Liquid AI, com a taxa de aceitação medida após cada época e melhorando até que os retornos decrescentes se instalassem.
Os números de benchmark vêm de seis tarefas baseadas em visão — VQA geral, VQA de texto, legendagem de imagens, VQA de gráficos, raciocínio complexo e conversa de múltiplos turnos — seguindo o que a postagem chama de benchmark MMSpec, usando um tamanho de bloco DSpark de 8. Em um M5 Max com MLX, a decodificação foi de 2.30x a 3.13x mais rápida por tarefa, com a latência de ponta a ponta melhorando de 1.56x a 2.62x. Em um M3 Ultra com llama.cpp, o decode melhorou de 1.57x a 2.14x e a ponta a ponta de 1.30x a 1.77x. Na H100, a postagem relata acelerações de decode de "20.4x a 2.66x" ao lado de melhorias de ponta a ponta de 1.64x a 2.27x — o intervalo como impresso na própria tabela da Liquid AI.
O suporte de integração desde o primeiro dia abrange llama.cpp, MLX-VLM e SGLang, com pull requests específicos nomeados na postagem: SGLang PR #40651, llama.cpp PR#29339 e MLX-VLM PR#2280. Executar sob o SGLang exige flags que incluem `--speculative-algorithm DSPARK`, um `--speculative-dspark-block-size` escolhido, e `--disable-radix-cache`; a comparação de linha de base é o mesmo comando com as três flags especulativas removidas. Os pesos são disponibilizados nos formatos Safetensors e GGUF no Hugging Face.
A própria postagem da Liquid AI nomeia o teto dessa técnica: a decodificação especulativa acelera apenas o decode, não a codificação visual nem o prefill, e em dispositivos de borda — que têm muito menos poder computacional do que GPUs de datacenter — o prefill consome uma parcela maior da latência de ponta a ponta, porque a imagem primeiro passa por um codificador visual antes mesmo de o backbone de linguagem começar a processar as centenas de tokens visuais resultantes mais o prompt de texto. A postagem enquadra isso explicitamente como a lei de Amdahl: quando a codificação e o prefill já dominam o tempo total, mesmo uma grande aceleração de decode gera apenas um ganho modesto de ponta a ponta, motivo pelo qual os multiplicadores de ponta a ponta relatados ficam atrás dos multiplicadores de decode em todos os benchmarks.
Para equipes que já executam o LFM2.5-VL-3B, o DSpark é um teste de baixo risco: é um drafter plug-and-play acoplado via uma flag de configuração, adiciona menos de 9% à pegada de memória e — como a especulação é exata — não pode alterar a qualidade da saída, apenas a latência. O número a observar antes de dedicar tempo de engenharia é a diferença entre a aceleração de decode e a aceleração de ponta a ponta na sua própria carga de trabalho; se o prefill dominar sua combinação de tráfego, como ocorre em hardware de borda segundo os próprios números da Liquid AI, o destacado 3.13x não aparecerá nos seus painéis.