Liquid AI lanzó LFM2.5-VL-3B, un modelo de visión-lenguaje de 3 mil millones de parámetros optimizado para la implementación en dispositivos y borde. El modelo empareja un codificador de visión SigLIP2 400M NaFlex con la columna vertebral de texto Liquid AI LFM2.5-2.6B, entrenado en ~34 billones de tokens con datos de visión 4× más que las versiones anteriores. Las características clave incluyen una fuerte comprensión de pantalla/UI en dispositivos, anclaje de objetos mejorado con consultas de lenguaje natural, razonamiento de múltiples imágenes y llamadas de función para tareas de solo texto y texto-visión.
LFM2.5-VL-3B está diseñado para inferencia en tiempo real y baja latencia en hardware del consumidor. Maneja imágenes de resolución nativa de hasta 512×512 píxeles sin ampliación, utiliza el procesamiento inteligente basado en parches para imágenes más grandes y ofrece latencia sub-segundo para consultas de un solo turno. El pre-entrenamiento incorporó datos de leyenda de imagen, OCR, anclaje e instrucción curados y sintéticos. El modelo admite la comprensión de visión multilingüe (árabe, chino, francés, alemán, japonés, coreano, español y más) y está disponible de código abierto en Hugging Face.
Para los equipos de producción que crean IA en dispositivos, LFM2.5-VL-3B señala el ritmo de la competencia en VLMs de forma pequeña. Con parámetros de 3B, apunta al procesamiento de documentos, la detección de objetos en tiempo real automotriz, flujos de trabajo pesados en OCR e inferencia de borde a escala. El aumento de datos de visión de 4× y los fuertes puntos de referencia de uso de herramientas indican que las arquitecturas de grado fronterizo ahora se envían a escala de borde. Los arquitectos que evalúan la inferencia VLM deben comparar con variantes LFM2.5 para entender si las ganancias de latencia de borde justifican la ventaja de precisión versus modelos más grandes basados en la nube.