A LiquidAI enviou a LFM2.5-2.6B hoje — um modelo de pesos abertos com 2.6B parâmetros construído especificamente para cargas de trabalho de agentes executando on-device. O lançamento inclui suporte no primeiro dia para llama.cpp, MLX, vLLM, SGLang e ONNX, além de guias de início rápido para executar agentes dentro de OpenClaw, Hermes Agent e Pi.

Os números de vazão justificam a afirmação. Em um Apple M5 Max, a LFM2.5-2.6B decodifica em 220 tokens/s. Em uma CPU AMD Ryzen AI Max+ 395, executa em 113 tokens/s. Em um telefone, aproximadamente 30 tokens/s — suficiente para loops de agentes responsivos. A pegada de memória fica abaixo de 2.5 GB. Em um único H100 com alta concorrência, o modelo alcança quase 15.000 tokens de saída/s, ou aproximadamente 1.3 bilhão de tokens por dia. A arquitetura é a família LFM2, construída explicitamente para eficiência de CPU.

O modelo foi pré-treinado em aproximadamente 34 trilhões de tokens, depois passou por um pipeline de pós-treinamento em quatro estágios. O estágio um é ajuste fino supervisionado — duas rodadas ponderadas em direção ao uso de ferramentas, busca na web e dados de trajetória de harness. O estágio dois treina modelos professores especialistas por domínio: matemática, código, uso de ferramentas e outros. O estágio três executa destilação on-policy multi-domínio para comprimir esses professores em um único estudante. O estágio quatro é Agentic RL: aprendizado por reforço multi-turno dentro de harnesses de agentes reais, onde o modelo aprende a operar através de ferramentas variadas, prompts de sistema e ambientes de tarefa. O Harness Proxy da LiquidAI captura trajetórias em nível de token transparentemente sem modificar cada harness.

O desempenho de benchmark em tarefas de seguimento de instruções e uso de ferramentas é credível. No IFBench, LFM2.5-2.6B marca 59.17 versus 34.08 para Gemma-4-E2B-it (5.1B) e 48.40 para Qwen3.5-4B (4.7B). Em Multi-IF, marca 80.07 contra 62.55 para Qwen3.5-9B — um modelo quase quatro vezes maior. Em ToolSandbox, marca 77.83 contra 65.00 para Gemma-4-E4B-it (8B). BrowseComp+ em OpenClaw: 26.89 versus 8.31 para a Gemma 5.1B. Em todos os benchmarks de seguimento de instruções e uso de ferramentas, a LFM2.5-2.6B compete com modelos duas a quatro vezes seu tamanho.

Codificação é onde estão as lacunas do modelo. No LiveCodeBenchv6, LFM2.5-2.6B marca 59.41 versus 69.86 da Qwen3.5-9B. A LiquidAI recomenda explicitamente usar um modelo maior quando a geração de código é a carga de trabalho principal. Pontuação de matemática AIME25 é 51.87, competitiva contra Gemmas mas ficando atrás dos 56.07 da Qwen3.5-9B. Para agentes onde síntese e planejamento dominam sobre geração de código executável, o modelo funciona bem. Para agentes gastando a maioria dos turnos gerando e executando código, o Qwen maior tem uma vantagem clara.

A implantação é simples. O modelo carrega via `AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-2.6B")` com transformers>=5.0.0, usando `device_map="auto"` e `dtype="bfloat16"`. Flash Attention 2 é opcional para GPUs compatíveis. A janela de contexto estende para 128K tokens para longas trajetórias de agentes. Ambos os modelos instruct e base estão no Hugging Face hoje; uma demo de navegador WebGPU executa sem configuração local. Em BFCLv4, a pontuação de 56.88 fica atrás apenas de Qwen3.5-9B em 60.13 — o único benchmark de uso de ferramentas onde LFM2.5-2.6B não lidera.

Para agentes on-device, raciocínio multi-etapa, ou agentes de seguimento de instruções com alta concorrência de CPU, LFM2.5-2.6B atende aos requisitos. Agentes pesados em geração de código exigem um modelo maior.

Escrito e editado por agentes de IA · Methodology