Liquid AI lançou LFM2.5-VL-3B em 12 de agosto de 2026 — um modelo visão-linguagem com 3.1B parâmetros para inferência em tempo real, no dispositivo. Os pesos abertos estão no Hugging Face. O modelo funciona em aproximadamente 3 GB de memória e decodifica a 228 tokens/segundo em um Apple M5 Max sem GPU discreta.

A arquitetura combina um codificador de visão SigLIP2 400M NaFlex com o backbone de texto LFM2.5-2.6B da Liquid, pré-treinado em aproximadamente 34 trilhões de tokens — 4× mais dados de visão do que a versão anterior. O tokenizador foi expandido para 128K por extensão in-place em vez de retreinamento completo, adicionando suporte a scripts não-latinos. O pós-treinamento envolveu ajuste fino supervisionado com destilação de conhecimento, treinamento "Antidoom" e aprendizado por reforço multi-recompensa. O modelo ignora chain-of-thought na inferência e responde diretamente — uma escolha com foco em latência.

Quatro áreas de benchmark mostram os maiores ganhos sobre LFM2-VL-3B. A compreensão de tela e UI disparou dramaticamente: ScreenSpot-v2 Desktop de 6.0 para 78.7, Mobile de 7.6 para 81.2, Web de 2.5 para 82.2. Grounding melhorou para 87.9 no RefCOCO-avg, acima de Gemma-4-E4B (8B) em 72.1 apesar do tamanho menor do LFM2.5-VL-3B. ToolSandbox subiu de 26.4 para 59.5, agora igualando Gemma-4-E2B-it (56.5). Raciocínio multi-imagem agora é suportado.

O desempenho de hardware é importante para implantação. O M5 Max atinge 228 tokens/segundo, AMD Ryzen AI Max+ 395 atinge 116 tokens/segundo, e Samsung Galaxy S26 Ultra atinge 20 tokens/segundo totalmente no dispositivo. Em um H100 com alta concorrência, Liquid relata 11.000 tokens/segundo de throughput de saída — aproximadamente 2× o que modelos da classe 4B produzem e mais rápido do que competidores 2B em seus testes. Isso se traduz em 1 bilhão de tokens de saída por dia em um único H100.

O suporte de inferência no primeiro dia abrange llama.cpp, MLX, vLLM, SGLang e ONNX. MLX e llama.cpp estão prontos para produção em Apple Silicon e laptops acelerados por IA AMD. vLLM e SGLang fornecem os números de throughput acima para implantação em servidor. O suporte ONNX habilita runtimes móveis e SDKs de fabricantes de hardware sem integração personalizada.

Em tarefas gerais de visão, LFM2.5-VL-3B tem média de 69.4, acima de Gemma-4-E4B (59.7) e Qwen3.5-4B (70.1) apesar desses modelos terem mais parâmetros. Compreensão de documentos: DocVQA 91.1, ChartQA 81.3. O modelo fica atrás em MMMU (48.4 vs. 50.3) e OCRBench v2 English (47.5 vs. 58.7) — uma troca que reflete seu foco. Raciocínio acadêmico profundo não é o workload alvo. O modelo prioriza pipelines de visão com alto volume e baixa latência.

O escopo prático é restrito por design: agentes de automação de tela, OCR de documento no dispositivo, fluxos de trabalho com muito grounding como busca visual e detecção de objetos via linguagem natural, e agentes de chamada de ferramenta que precisam de contexto de visão sem latência de ida e volta em nuvem. Para pipelines que precisam de chain-of-thought ou raciocínio classe MMMU, procure em outro lugar. Para aqueles que executam em laptops, dispositivos móveis ou GPUs únicas com alto throughput, LFM2.5-VL-3B é atualmente um dos poucos modelos sub-4B com scores de grounding e compreensão de tela que justificam a troca.