LiquidAI lanzó tres puntos de control de modelo DSpark draft para su familia LFM2.5—LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B—usando decodificación especulativa para cambiar aumento mínimo de memoria por grandes speedups de inferencia. En una sola GPU H100, el modelo draft LFM2.5-8B-A1B entrega hasta 3.18x mejora de rendimiento (428 → 1362 tokens/seg en MATH500), mientras que on-device (MacBook M4 Max con Metal) los speedups varían de 1.18x a 2.87x dependiendo del tamaño del modelo. Críticamente, la calidad de salida es sin cambios—la decodificación greedy garantiza que las secuencias emitidas sean idénticas a la línea base por construcción.
DSpark combina tres técnicas: una columna vertebral paralela estilo DFlash que produce estados ocultos para todos los tokens draft en un único pase forward, una cabeza secuencial ligera de cadena de Markov para aumentar las tasas de aceptación, y un verificador programado por confianza que poda sufijos de token de baja confianza cuando el costo de verificación supera los ahorros. Los modelos draft tienen ~300M parámetros cada uno con solo 5 capas de atención, manteniendo la sobrecarga mínima. Para escenarios de function-calling, LFM2.5-2.6B ve una reducción de latencia del 57% en promedio en cinco conjuntos de datos multi-herramienta.
La accesibilidad de despliegue importa: soporte de primer día para llama.cpp y SGLang significa que los practicantes pueden enviar estos modelos inmediatamente en dispositivo y nube sin infraestructura personalizada. Para arquitectos orientados a inferencia interactiva y bucles de agente donde la latencia domina, estos números sugieren que las optimizaciones de inferencia post-entrenamiento (no solo escalado de parámetros bruto) están generando mejoras materiales de wall-clock. El speedup promedio de 2.67x en H100 a costo de calidad de salida cero es un punto de dato en la curva de inferencia.