Liquid AI lanzó LFM2.5-VL-3B el 12 de agosto de 2026 — un modelo de visión-lenguaje con 3.1B parámetros para inferencia en tiempo real, en el dispositivo. Los pesos abiertos están en Hugging Face. El modelo funciona en aproximadamente 3 GB de memoria y decodifica a 228 tokens/segundo en un Apple M5 Max sin GPU discreta.

La arquitectura empareja un codificador de visión SigLIP2 400M NaFlex con el backbone de texto LFM2.5-2.6B de Liquid, pre-entrenado en aproximadamente 34 billones de tokens — 4× más datos de visión que la versión anterior. El tokenizador se expandió a 128K mediante extensión in-place en lugar de reentrenamiento completo, agregando soporte de scripts no-latinos. El post-entrenamiento implicó ajuste fino supervisado con destilación de conocimiento, entrenamiento "Antidoom" y aprendizaje por refuerzo multi-recompensa. El modelo omite chain-of-thought en inferencia y responde directamente — una opción enfocada en latencia.

Cuatro áreas de benchmark muestran las mayores ganancias sobre LFM2-VL-3B. La comprensión de pantalla e IU se disparó dramáticamente: ScreenSpot-v2 Desktop de 6.0 a 78.7, Mobile de 7.6 a 81.2, Web de 2.5 a 82.2. Grounding mejoró a 87.9 en RefCOCO-avg, superando a Gemma-4-E4B (8B) en 72.1 a pesar del tamaño más pequeño de LFM2.5-VL-3B. ToolSandbox subió de 26.4 a 59.5, ahora igualando a Gemma-4-E2B-it (56.5). El razonamiento multi-imagen ahora es compatible.

El desempeño de hardware importa para la implementación. El M5 Max alcanza 228 tokens/segundo, AMD Ryzen AI Max+ 395 alcanza 116 tokens/segundo, y Samsung Galaxy S26 Ultra alcanza 20 tokens/segundo completamente en el dispositivo. En un H100 con alta concurrencia, Liquid reporta 11.000 tokens/segundo de throughput de salida — aproximadamente 2× lo que producen modelos de clase 4B y más rápido que competidores 2B en sus pruebas. Eso se traduce en 1 billón de tokens de salida por día en un único H100.

El soporte de inferencia el primer día abarca llama.cpp, MLX, vLLM, SGLang y ONNX. MLX y llama.cpp están listos para producción en Apple Silicon y laptops con aceleración IA de AMD. vLLM y SGLang proporcionan los números de throughput anteriores para implementación en servidor. El soporte ONNX permite runtimes móviles y SDKs de proveedores de hardware sin integración personalizada.

En tareas generales de visión, LFM2.5-VL-3B promedian 69.4, superior a Gemma-4-E4B (59.7) y Qwen3.5-4B (70.1) a pesar de que esos modelos tienen más parámetros. Comprensión de documentos: DocVQA 91.1, ChartQA 81.3. El modelo se queda atrás en MMMU (48.4 vs. 50.3) y OCRBench v2 English (47.5 vs. 58.7) — un trade-off que refleja su enfoque. El razonamiento académico profundo no es la carga de trabajo objetivo. El modelo prioriza pipelines de visión de alto volumen y baja latencia.

El alcance práctico es limitado por diseño: agentes de automatización de pantalla, OCR de documentos en el dispositivo, flujos de trabajo con mucho grounding como búsqueda visual y detección de objetos mediante lenguaje natural, y agentes de llamada de herramientas que necesitan contexto de visión sin latencia de ida y vuelta en la nube. Para pipelines que necesitan chain-of-thought o razonamiento de clase MMMU, busque en otro lugar. Para los que se ejecutan en laptops, dispositivos móviles o GPUs únicas con alto throughput, LFM2.5-VL-3B es actualmente uno de los pocos modelos sub-4B con scores de grounding y comprensión de pantalla que justifican el trade-off.