Liquid AI lanzó modelos de borrador DSpark para la familia LFM2.5 (1.2B-Instruct, 2.6B y 8B-A1B), agregando decodificación especulativa—una técnica donde un pequeño modelo de borrador propone candidatos de token que un modelo de destino más grande verifica en un solo paso—sin cambiar la calidad de salida. Las mejoras de velocidad son sustanciales: hasta 3,18x de mejora de rendimiento en una GPU H100 y hasta 2,87x en un MacBook Pro M4 Max usando inferencia en dispositivo. Los modelos de borrador tienen aproximadamente 300M parámetros cada uno, agregando mínima sobrecarga de memoria.
El impacto más significativo aparece en cargas de trabajo agentes donde el modelo razona antes de cada llamada de herramienta. Entre varios escenarios de llamadas de función en el benchmark BFCL, DSpark reduce la latencia en 57% en promedio para LFM2.5-2.6B. Esto importa porque los agentes incurren en el costo de decodificación varias veces por turno—una para planificación, una después de cada llamada de herramienta, y nuevamente para replanificación. La velocidad varía por tarea: razonamiento MATH en H100 logra 3,18x, mientras que GSM8K (que requiere menos saltos) produce 1,29x, rastreando la tasa de aceptación del modelo.
La arquitectura DSpark unifica tres componentes: una columna vertebral paralela de estilo DFlash que genera todos los tokens de borrador en un solo paso adelante (rápido pero inicialmente incoherente), una cabeza secuencial de cadena de Markov ligera que agrega dependencia entre tokens para elevar la aceptación en posiciones posteriores, y un verificador programado por confianza que poda sufijos de baja aceptación cuando el costo de verificación excede los ahorros. La técnica es exacta: la verificación de destino garantiza que la salida sea idéntica a la decodificación codicioso de línea de base, por lo que no se sacrifica precisión.
Los arquitectos que implementan agentes locales y flujos de trabajo de razonamiento en dispositivo deben rastrear este lanzamiento: LFM2.5-DSpark se envía con soporte en día uno en llama.cpp y SGLang, haciéndolo inmediatamente utilizable. El equipo de Liquid AI entrena borradores en datos diversos (SFT, chat, código, llamada de función) y selecciona épocas por tasa de aceptación en lugar de pérdida—un cambio de señal que sugiere el verdadero cuello de botella en el rendimiento de decodificación: no cómputo, sino ancho de banda de memoria y coherencia de caché.