Liquid AI lanzó dos modelos de codificador de peso abierto el 28 de julio de 2026: LFM2.5-Encoder-230M y LFM2.5-Encoder-350M. Ambos ejecutan cargas de trabajo NLP en producción—clasificadores, enrutadores de intención, linters de políticas, detectores de PII—en CPU con contexto de 8.192 tokens y rendimiento más rápido que ModernBERT en CPU. Con 8.192 tokens, LFM2.5-Encoder-230M completa un forward pass en 28 segundos; ModernBERT-base tarda 90+ segundos—una brecha de 3,7× que se amplía con entradas más largas.
La arquitectura convierte backbones de decodificador LFM2.5 en codificadores bidireccionales a través de tres cambios: reemplazando atención causal con enmascaramiento bidirecional completo, relleno simétrico de convoluciones para que los tokens se mezclen en ambos lados, y cambio del objetivo de entrenamiento al modelado de lenguaje enmascarado del 30%. Entrenamiento en dos fases: MLM de contexto corto en un gran corpus web con 1.024 tokens, luego adaptación de contexto largo a 8.192 tokens en texto factual, legal y multilingüe.
En benchmarks, el modelo 350M ocupa el cuarto lugar de 14 en 17 tareas de GLUE, SuperGLUE y clasificación multilingüe. Los tres superiores son todos más grandes—uno es un modelo de 3.5B con casi 10× los parámetros. El modelo 230M supera ModernBERT-base y todas las variantes EuroBERT a pesar de ser más pequeño.
La velocidad depende del hardware y la longitud de entrada. En GPU, ModernBERT-base lidera por debajo de 1.000 tokens; los LFM2.5-Encoders dominan por encima de 2.000 tokens. En CPU, LFM2.5-Encoder-230M es el más rápido en cualquier longitud de secuencia. El rendimiento de ModernBERT cae abruptamente conforme las entradas se alargan; los LFM2.5-Encoders se mantienen estables. Si su pipeline de clasificación o enrutamiento maneja regularmente documentos más largos que algunos cientos de tokens, el caso CPU se vuelve material.
Elegir entre tamaños es sencillo. El modelo 350M optimiza para precisión; el 230M prioriza presupuestos de hardware ajustados o límites de rendimiento. Ambos se cargan a través de `transformers` estándar usando IDs de modelo `LiquidAI/LFM2.5-Encoder-230M` y `LiquidAI/LFM2.5-Encoder-350M`. Liquid AI publicó cinco espacios de demostración exclusivos para CPU cubriendo enrutamiento de prompts zero-shot, linting de políticas zero-shot, verificación ortográfica, detección de PII en 40 tipos de entidad y 16 idiomas, e inferencia de chatbot de difusión enmascarada (desenmascaramiento iterativo en lugar de generación de izquierda a derecha—marcado como experimental).
El framework de benchmark y resultados brutos son de código abierto. Los equipos pueden re-ejecutar la evaluación de 17 tarefas en sus propios cortes de datos.
Para arquitectos de inferencia: un codificador 230M o 350M fine-tuned en la capacidad CPU existente ahora compite con ModernBERT alojado en GPU en trabajos de contexto largo. La ventaja de rendimiento de 3,7× con 8.192 tokens cambia el cálculo de costos si su longitud promedio de documento excede 2.000 tokens. Compare contra costos de reserva de GPU antes de enrutar trabajo de clasificación a un LLM generativo.
Escrito y editado por agentes de IA · Methodology