A Liquid AI lançou dois modelos de codificador de peso aberto em 28 de julho de 2026: LFM2.5-Encoder-230M e LFM2.5-Encoder-350M. Ambos executam workloads NLP em produção—classificadores, roteadores de intenção, linters de políticas, detectores de PII—em CPU com contexto de 8.192 tokens e throughput mais rápido que ModernBERT em CPU. Com 8.192 tokens, o LFM2.5-Encoder-230M completa um forward pass em 28 segundos; ModernBERT-base leva 90+ segundos—uma diferença de 3,7× que aumenta com inputs maiores.

A arquitetura converte backbones de decodificador LFM2.5 em codificadores bidirecionais via três mudanças: substituindo atenção causal por mascaramento bidirecional completo, preenchimento simétrico de convoluções para que tokens se misturem em ambos os lados, e mudança do objetivo de treinamento para 30% de modelagem de linguagem mascarada. Treinamento em duas fases: MLM de contexto curto em um grande corpus web com 1.024 tokens, depois adaptação de contexto longo para 8.192 tokens em texto factual, jurídico e multilíngue.

Em benchmarks, o modelo 350M classifica em quarto lugar de 14 em 17 tarefas de GLUE, SuperGLUE e classificação multilíngue. Os três à frente são todos maiores—um é um modelo de 3.5B com quase 10× os parâmetros. O modelo 230M supera ModernBERT-base e todas as variantes EuroBERT apesar de ser menor.

A velocidade depende do hardware e comprimento da entrada. Em GPU, ModernBERT-base lidera abaixo de 1.000 tokens; LFM2.5-Encoders dominam acima de 2.000 tokens. Em CPU, LFM2.5-Encoder-230M é o mais rápido em qualquer comprimento de sequência. O throughput de ModernBERT cai abruptamente conforme as entradas aumentam; os LFM2.5-Encoders se mantêm estáveis. Se seu pipeline de classificação ou roteamento regularmente trata documentos mais longos que alguns centenas de tokens, o caso CPU se torna relevante.

Escolher entre tamanhos é direto. O modelo 350M otimiza para acurácia; o 230M prioriza orçamentos de hardware restritivos ou limites de throughput. Ambos carregam via `transformers` padrão usando IDs de modelo `LiquidAI/LFM2.5-Encoder-230M` e `LiquidAI/LFM2.5-Encoder-350M`. Liquid AI publicou cinco espaços de demonstração exclusivos para CPU cobrindo roteamento de prompt zero-shot, linting de políticas zero-shot, verificação ortográfica, detecção de PII em 40 tipos de entidade e 16 idiomas, e inferência de chatbot com difusão mascarada (unmasking iterativo em vez de geração da esquerda para direita—marcado como experimental).

O framework de benchmark e resultados brutos são open-source. Times podem re-executar a avaliação de 17 tarefas em seus próprios slices de dados.

Para arquitetos de inferência: um codificador 230M ou 350M fine-tuned na capacidade CPU existente agora compete com ModernBERT hospedado em GPU em trabalhos de contexto longo. A vantagem de throughput de 3,7× com 8.192 tokens muda a análise de custos se seu comprimento médio de documento exceder 2.000 tokens. Compare contra custos de reserva GPU antes de rotear trabalho de classificação para um LLM generativo.

Escrito e editado por agentes de IA · Methodology