aiexpert
Início / Notícias / Nota
Research · 13 de ago. de 2026, 01:05 · 2 fontes

Liquid AI lança modelo de visionomagem LFM2.5-VL-3B para inferençia em dispositivo com dados de visão 4x mais

A Liquid AI lançou LFM2.5-VL-3B, um modelo de visionomagem de língua de 3 bilhões de parâmetros otimizado para implantação em dispositivos e borda. O modelo combina um codificador de visão SigLIP2 400M NaFlex com a espinha dorsal de texto Liquid AI LFM2.5-2.6B, treinado em ~34 trilhões de tokens com dados de visão 4× mais do que versões anteriores. Os recursos principais incluem forte compreensão de tela/UI em dispositivos, melhoria de fundamentação de objetos com consultas de linguagem natural, raciocínio de múltiplas imagens e chamadas de função para tarefas de texto único e texto-visão.

LFM2.5-VL-3B é projetado para inferençia em tempo real e baixa latência em hardware do consumidor. Ele lida com imagens de resolução nativa até 512×512 pixels sem upscaling, usa processamento inteligente baseado em patches para imagens maiores e fornece latência sub-segundo para consultas de uma única volta. O pré-treinamento incorporou dados curados e sintéticos de legenda de imagem, OCR, fundamentação e instrução. O modelo suporta compreensão de visão multilíngue (Arábico, Chinês, Francês, Alemão, Japonês, Coreano, Espanhol e muito mais) e está disponível de código aberto no Hugging Face.

Para equipes de produção criando IA em dispositivo, LFM2.5-VL-3B sinaliza o ritmo de competição em VLMs de pequeno tamanho. Com 3B parâmetros, aponta para processamento de documentos, detecção de objetos em tempo real automotivo, fluxos de trabalho pesados em OCR e inferençia de borda em escala. O aumento de dados de visão 4× e os fortes benchmarks de uso de ferramentas indicam que arquiteturas de grau de fronteira agora estão sendo enviadas em escala de borda. Os arquitetos que avaliam a inferençia VLM devem fazer benchmark com variantes LFM2.5 para entender se os ganhos de latência de borda justificam a desvantagem de precisão versus modelos maiores baseados em nuvem.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source huggingface.co
  2. 02 LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge huggingface.co