Liquid AI lanzó LFM2.5-VL-DSpark, un drafter de decodificación especulativa para su modelo de lenguaje y visión LFM2.5-VL-3B, según la publicación de la compañía en su blog de Hugging Face. El drafter reduce la latencia de decodificación hasta 3.13x en dispositivo y 2.66x en una GPU H100, con ganancias de extremo a extremo de hasta 2.62x y 2.27x respectivamente, sin alterar la calidad de la salida, según indica la publicación.
El mecanismo sigue la misma receta que Liquid AI usó para sus drafters LFM2.5-DSpark de solo texto: el modelo borrador toma un conjunto fijo de estados ocultos del modelo objetivo en capas determinadas y se condiciona en ellos para proponer un bloque de k tokens candidatos, que el modelo objetivo luego verifica. Lo que permite que la variante de visión funcione sin un algoritmo de inferencia separado es que los parches de imagen y los tokens de texto se proyectan en una representación compartida antes de esas capas muestreadas, de modo que el drafter ve vectores de estado oculto de idéntica dimensionalidad sin importar la modalidad de entrada. La publicación de Liquid AI es explícita en que la decodificación especulativa es exacta: el modelo objetivo verifica cada token propuesto, por lo que la salida greedy del pipeline acelerado es igual a la del modelo objetivo ejecutándose solo.
El drafter en sí es una arquitectura simplificada solo de atención con 4 capas y un tamaño de bloque de 9, elegido tras que Liquid AI realizara ablaciones con 3, 4 y 5 capas, según la publicación. Su desglose de componentes, tal como se indica en el blog: una pila decodificadora de 193.0M de parámetros, una proyección de estado oculto de 21.0M de parámetros, una cabeza de Markov de 65.5M de parámetros, y normas más una cabeza de confianza de 6.4k parámetros, con un total de aproximadamente 279.5M — un aumento del 8.9% respecto al tamaño del modelo objetivo de 3B. El entrenamiento se ejecutó durante 10 épocas sobre una mezcla de ajuste fino supervisado (SFT) de visión y lenguaje ponderada hacia las cargas de trabajo de servicio esperadas por Liquid AI, con la tasa de aceptación medida después de cada época y mejorando hasta que los rendimientos decrecientes se hicieron presentes.
Las cifras del benchmark provienen de seis tareas basadas en visión — VQA general, VQA de texto, subtitulado de imágenes, VQA de gráficos, razonamiento complejo y conversación de múltiples turnos — siguiendo lo que la publicación denomina el benchmark MMSpec, usando un tamaño de bloque DSpark de 8. En un M5 Max con MLX, la decodificación se ejecutó de 2.30x a 3.13x más rápido según la tarea, con una latencia de extremo a extremo mejorando de 1.56x a 2.62x. En un M3 Ultra con llama.cpp, la decodificación mejoró de 1.57x a 2.14x y el extremo a extremo de 1.30x a 1.77x. En H100, la publicación reporta aceleraciones de decodificación de "20.4x a 2.66x" junto con mejoras de extremo a extremo de 1.64x a 2.27x — el rango tal como aparece impreso en la propia tabla de Liquid AI.
El soporte de integración desde el primer día cubre llama.cpp, MLX-VLM y SGLang, con pull requests específicos mencionados en la publicación: SGLang PR #40651, llama.cpp PR#29339 y MLX-VLM PR#2280. Lanzarlo bajo SGLang requiere flags que incluyen `--speculative-algorithm DSPARK`, un `--speculative-dspark-block-size` elegido y `--disable-radix-cache`; la comparación de referencia es el mismo comando idéntico con las tres flags especulativas eliminadas. Los pesos se distribuyen en formatos Safetensors y GGUF en Hugging Face.
La propia publicación de Liquid AI señala el límite de esta técnica: la decodificación especulativa acelera solo la decodificación, no la codificación visual ni el prefill, y en dispositivos edge — que tienen mucho menos cómputo que las GPU de centro de datos — el prefill consume una mayor proporción de la latencia de extremo a extremo, porque la imagen primero pasa por un codificador visual antes de que el backbone de lenguaje siquiera comience a procesar los cientos de tokens visuales resultantes más el prompt de texto. La publicación enmarca esto explícitamente como la ley de Amdahl: cuando la codificación y el prefill ya dominan el tiempo total, incluso una gran aceleración en la decodificación produce solo una ganancia modesta de extremo a extremo, razón por la cual los multiplicadores de extremo a extremo reportados quedan por debajo de los multiplicadores de decodificación en todos los benchmarks.
Para los equipos que ya ejecutan LFM2.5-VL-3B, DSpark es una prueba de bajo riesgo: es un drafter de inserción directa que se adjunta mediante una flag de configuración, agrega menos del 9% al footprint de memoria y — dado que la especulación es exacta — no puede cambiar la calidad de la salida, solo la latencia. La cifra a vigilar antes de comprometer tiempo de ingeniería es la brecha entre la aceleración de decodificación y la aceleración de extremo a extremo en su propia carga de trabajo; si el prefill domina su mezcla de tráfico, como ocurre en hardware edge según las propias cifras de Liquid AI, el titular de 3.13x no aparecerá en sus dashboards.