Liquid AI Lanza Modelo Agente LFM2.5-2.6B en Dispositivo; 220 tok/s en M5 Max, Coincide con Modelos 4-10B
Liquid AI lanzó LFM2.5-2.6B el 4 de agosto de 2026, un modelo de 2.6 mil millones de parámetros diseñado para cargas de trabajo agentes en dispositivo sin dependencia en la nube. El modelo se ejecuta a 220 tokens/segundo en Apple M5 Max, 113 tok/s en AMD Ryzen CPU y hasta 30 tok/s en teléfonos, todo dentro de 2.5 GB de memoria. Fue pre-entrenado en ~34 billones de tokens con una ventana de contexto de 128K y post-entrenado en cuatro etapas: ajuste supervisionado, especialización de expertos, destilación on-policy multidomain y aprendizaje por refuerzo agéntico dentro de arneses activos (OpenClaw, Hermes Agent).
LFM2.5-2.6B es competitivo con modelos 4-10x más grandes en uso de herramientas, seguimiento de instrucciones y tareas agénticas multietapa. En benchmarks de uso de herramientas (BFCLv4, ToolSandbox, Claw-Eval), iguala o supera modelos Gemma 5-8B y Qwen 4.7-9.7B. La arquitectura utiliza principalmente convoluciones cortas con capas de atención selectiva (convoluciones LIV), que mantienen estado de tamaño constante por token y eliminan sobrecarga de caché KV—una ventaja de eficiencia clave sobre transformadores densos. La inferencia de GPU alcanza 15K tokens de salida/segundo en una sola H100 con alta concurrencia.
Para arquitectos que envían agentes: los modelos agentes en dispositivo eliminan costos por token e habilitan inferencia con privacidad de forma predeterminada. El entrenamiento de LFM2.5-2.6B dentro de arneses reales (no trazas sintéticas) debe mejorar la compatibilidad real del uso de herramientas. Los 30 tok/s en teléfonos abren casos de uso de robótica e IA integrada. El giro del modelo de costos—de restricción de gasto de tokens a restricción de rendimiento local—permite agentes de fondo continuo. El énfasis de Liquid en arquitecturas basadas en convolución en lugar de pura atención puede señalar hacia dónde van los modelos de borde eficientes.
Fuentes
- Primary source
- Hugging Face / Liquid AI
“LFM2.5-2.6B is built to power capable agents entirely on-device... Efficient inference: 220 tok/s on an Apple M5 Max and 113 tok/s on an AMD Ryzen CPU, in under 2.5 GB of memory”
- Hugging Face / Liquid AI
“We evaluated LFM2.5-2.6B against models up to ~4x its size on STEM, instruction following, tool use, and agentic tasks. It is the smallest model in the group, yet it competes with and often beats the rest”