Liquid AI Lança Modelo Agente LFM2.5-2.6B em Dispositivo; 220 tok/s em M5 Max, Corresponde a Modelos 4-10B
Liquid AI lançou LFM2.5-2.6B em 4 de agosto de 2026, um modelo de 2,6 bilhões de parâmetros projetado para cargas de trabalho agentes em dispositivo sem dependência em nuvem. O modelo executa a 220 tokens/segundo em Apple M5 Max, 113 tok/s em AMD Ryzen CPU e até 30 tok/s em telefones, tudo dentro de 2,5 GB de memória. Foi pré-treinado em ~34 trilhões de tokens com janela de contexto de 128K e pós-treinado em quatro estágios: afinação supervisionada, especialização de especialistas, destilação on-policy multi-domínio e aprendizado por reforço agência dentro de armações ativas (OpenClaw, Hermes Agent).
LFM2.5-2.6B é competitivo com modelos 4-10x maiores em uso de ferramentas, seguimento de instruções e tarefas agências multi-etapas. Em benchmarks de uso de ferramentas (BFCLv4, ToolSandbox, Claw-Eval), ele combina ou supera modelos Gemma 5-8B e Qwen 4,7-9,7B. A arquitetura usa principalmente convoluções curtas com camadas de atenção seletiva (convoluções LIV), que mantêm estado de tamanho constante por token e eliminam sobrecarga de cache KV—uma vantagem de eficiência chave sobre transformers densos. A inferência de GPU atinge 15K tokens de saída/segundo em um único H100 em alta concorrência.
Para arquitetos enviando agentes: modelos agentes em dispositivo eliminam custos por token e permitem inferência com privacidade por padrão. O treinamento LFM2.5-2.6B dentro de armações reais (não traços sintéticos) deve melhorar a compatibilidade de uso de ferramenta real. Os 30 tok/s em telefones abrem casos de uso de robótica e IA incorporada. O flip de modelo de custo—de restrição de gasto de token para restrição de taxa de transferência local—permite agentes de fundo contínuo. A ênfase da Líquida em arquiteturas baseadas em convolução em vez de pura atenção pode sinalizar para onde os modelos de borda eficientes estão indo.
Fontes
- Primary source
- Hugging Face / Liquid AI
“LFM2.5-2.6B is built to power capable agents entirely on-device... Efficient inference: 220 tok/s on an Apple M5 Max and 113 tok/s on an AMD Ryzen CPU, in under 2.5 GB of memory”
- Hugging Face / Liquid AI
“We evaluated LFM2.5-2.6B against models up to ~4x its size on STEM, instruction following, tool use, and agentic tasks. It is the smallest model in the group, yet it competes with and often beats the rest”