LFM2 da Liquid AI: a arquitetura alternativa para l'edge
O LFM2 da Liquid AI não é apenas mais um transformer: trata-se de uma família de pequenos modelos (350M a 8B) baseada em uma arquitetura híbrida em que a maioria das camadas usa convoluções curtas, e não atenção. Resultado anunciado pela Liquid AI: decodificação e prefill cerca de duas vezes mais rápidos que os do Qwen3 de mesmo tamanho em CPU, com um consumo de memória que cresce pouco com o contexto. Este guia explica o que essa arquitetura realmente muda, como instalar o LFM2 com Ollama ou llama.cpp, qual velocidade esperar sem GPU e para quais usos essa escolha supera um transformer tradicional.
#LFM2 da Liquid AI: por que um modelo pensado para a CPU
A Liquid AI é uma empresa originária do MIT (CSAIL), fundada em 2023 em torno das "redes neurais líquidas" e dos modelos de estado contínuo. Após uma primeira geração LFM1 fechada, a empresa publicou em julho de 2025 os pesos do LFM2, sua segunda geração, em três tamanhos: 350M, 700M e 1,2B de parâmetros. Outras variantes vieram depois (2,6B, uma versão MoE 8B-A1B, modelos de visão e áudio e, em seguida, a geração LFM2.5). O foco permanece o mesmo: esses modelos visam a execução no dispositivo, ou seja, em um telefone, um notebook sem placa de vídeo, um mini-PC ou uma placa embarcada.
Quase todos os pequenos modelos abertos que você conhece (Qwen3, Gemma 3, Llama 3.2, SmolLM) são transformers clássicos: cada camada aplica atenção a todo o contexto. Isso funciona muito bem em GPUs, mas, em CPUs, cada token gerado precisa reler um cache de chave-valor (KV cache) que cresce com a conversa, e o prefill de um prompt longo tem um custo elevado. O LFM2 aborda precisamente esses dois pontos ao substituir a maioria das camadas de atenção por blocos de convolução curta, que consomem muito menos memória e largura de banda.
- Alvo
- Inferência no dispositivo: CPU x86 ou ARM, NPU, GPU integrado. O GPU dedicado não é o foco principal, embora também funcione.
- Promessa quantificada
- A Liquid AI anuncia decodificação e prefill até 2 vezes mais rápidos que o Qwen3 em tamanho comparável no CPU (medidas publicadas em um AMD Ryzen AI 9 HX 370 e um Samsung Galaxy S24 Ultra).
- Qualidade
- Com o mesmo número de parâmetros, o LFM2 se posiciona no mesmo nível ou um pouco acima dos transformers concorrentes nos benchmarks de conhecimento, instruções e matemática; o 1,2B rivaliza com o Qwen3-1,7B no MMLU e no IFEval.
- Licença
- LFM Open License v1.0: uso comercial livre abaixo de um limite de faturamento anual (10 milhões de dólares); acima desse valor, é necessário entrar em contato com a Liquid AI. Não se trata da Apache 2.0: releia o texto antes de uma implantação em ambiente empresarial.
#O que muda com a arquitetura híbrida LFM
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O LFM2 empilha 16 blocos. Dez são blocos de convolução de curto alcance com duas portas (double-gated short-range convolution), seis são blocos de atenção com consultas agrupadas (grouped query attention, GQA), como em um transformer moderno. A Liquid AI descreve esses blocos de convolução como operadores LIV (linear input-varying): os pesos aplicados a cada posição dependem da entrada, o que dá ao bloco uma forma de seletividade semelhante à dos modelos de espaço de estados (Mamba) ou das RNNs modernas, sem o estado recorrente complexo desses modelos.
Concretamente, um bloco de convolução só analisa alguns tokens vizinhos. Seu custo por token é constante, independentemente do contexto já gerado, e não armazena nada no cache KV. Apenas os seis blocos de atenção mantêm um cache, contra 28 ou 36 camadas em um transformer de tamanho semelhante. Duas consequências diretas no CPU:
- Decodificação mais rápida
- Gerar um token consiste principalmente em reler os pesos e o cache KV a partir da RAM. Com menos cache para reler, a largura de banda da memória, que é o verdadeiro gargalo de uma CPU, é melhor aproveitada.
- Prefill eficaz
- Processar um prompt de 4.000 tokens (um documento para RAG, um histórico de chat) custa proporcionalmente menos do que em um transformer completo, pois dez dos dezesseis blocos operam com uma janela local.
- Memória estável
- O consumo aumenta lentamente com o contexto: o cache KV de seis camadas continua pequeno, o que é relevante para um telefone ou uma placa com 4 ou 8 GB de RAM compartilhada.
- Contexto nativo 32k
- O LFM2 foi treinado com uma janela de 32.768 tokens (128k em algumas variantes mais recentes), o suficiente para resumos e RAG leves.
No treinamento, a Liquid AI usou cerca de 10.000 bilhões de tokens para a primeira geração LFM2, com uma mistura dominada pelo inglês, cerca de 20% de dados multilíngues (incluindo francês, alemão, espanhol, árabe, chinês, japonês e coreano) e um pouco de código, além de uma destilação a partir do LFM1-7B interno. É por isso que um LFM2-1,2B consegue manter uma conversa razoável em francês, o que não é garantido para todos os modelos desse tamanho.
#Família LFM2: tamanhos e variantes
Todas as variantes compartilham a mesma arquitetura básica e o mesmo formato de chat (tags im_start/im_end no estilo ChatML). A seguir estão as relevantes para uso edge, com o tamanho aproximado do arquivo GGUF em Q4_K_M, que corresponde aproximadamente à RAM ocupada pelos pesos quando o modelo é executado na CPU.
- LFM2-350M
- Aproximadamente 250 MB em Q4. Classificação, extração, reescrita curta. Funciona em quase qualquer dispositivo, incluindo Raspberry Pi ou antigos notebooks.
- LFM2-700M
- Aproximadamente 450 MB em Q4. Um bom equilíbrio para um celular recente ou um assistente muito leve.
- LFM2-1.2B
- Aproximadamente 730 MB em Q4. Modelo de referência da família: chat, resumo, RAG simples, chamadas de ferramentas. É o modelo que este guia instala.
- LFM2-2.6B
- Aproximadamente 1,5 GB em Q4. Lançado no fim de 2025, muito mais sólido em raciocínio e em tarefas multilíngues, ainda roda com facilidade em um notebook sem GPU.
- LFM2-8B-A1B
- Mistura de Especialistas: 8,3B de parâmetros ao todo, aproximadamente 1,5B ativos por token. Cerca de 5 GB em Q4: é necessária a mesma quantidade de RAM de um modelo de 8B, mas a velocidade continua sendo a de um modelo pequeno.
- Variantes especializadas
- LFM2-VL (visão, 450M e 1,6B), LFM2-Audio e variantes com ajuste fino para extração de dados, RAG ou chamadas de ferramentas. A geração LFM2.5 (a partir de janeiro de 2026) reutiliza a arquitetura com treinamento prolongado; o catálogo do site lista suas fichas, incluindo as dos modelos de 2,6B e 7B.
#Pré-requisitos
Nada de exótico. O ponto importante é ter uma versão recente do motor de inferência: o suporte à arquitetura LFM2 foi adicionado ao llama.cpp em julho de 2025 e ao Hugging Face Transformers na versão 4.54. As versões de Ollama e de LM Studio publicadas desde então incluem esse suporte, desde que sejam atualizadas.
- Máquina
- Qualquer PC ou Mac recente. Um CPU com 4 núcleos e 8 GB de RAM é suficiente para o 1,2B; considere 16 GB para o 8B-A1B.
- Ollama atualizado
- O Ollama escuta por padrão em http://localhost:11434. Atualize-o antes de baixar o modelo: uma versão anterior ao verão de 2025 rejeitará o GGUF com um erro de arquitetura desconhecida.
- Ou llama.cpp
- Um binário recente (compilado ou baixado das releases do GitHub) dá acesso a llama-cli, llama-server e principalmente llama-bench para medir a velocidade.
- Python opcional
- Para usar os pesos originais (não quantizados) com Transformers ≥ 4.54, por exemplo, para fine-tuning ou exportação para um SDK móvel.
#Instalar e testar o LFM2 localmente
A Liquid AI publica seus modelos no Hugging Face sob a organização LiquidAI, com um repositório de pesos originais (LiquidAI/LFM2-1.2B) e um repositório GGUF já quantizado (LiquidAI/LFM2-1.2B-GGUF) para cada tamanho. O caminho mais simples é baixar diretamente esse GGUF no Ollama, sem passar por um Modelfile.
- 01Atualizar o OllamaNo Linux, execute novamente o script de instalação oficial; no macOS e no Windows, o aplicativo se atualiza automaticamente ou pelo seu menu. Verifique com ollama --version.
- 02Baixar o GGUF do Hugging FaceA sintaxe hf.co/organisation/dépôt:quantification funciona com qualquer repositório GGUF público. Para LFM2-1.2B em Q4_K_M, o download pesa aproximadamente 730 MB.
- 03Iniciar um primeiro chatollama run abre uma sessão interativa. Faça uma pergunta em francês para verificar a qualidade do idioma antes de se aprofundar.
- 04Forçar o uso da CPU para compararSe sua máquina tiver uma GPU, você pode desativá-la para esse modelo com o parâmetro num_gpu definido como 0 e observar o comportamento real usando apenas a CPU.
- 05Conectar uma interfaceO modelo aparece imediatamente em Open WebUI, LM Studio ou qualquer cliente compatível com OpenAI apontado para a porta 11434.
O nome hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M é longo para digitar; crie um alias local com ollama cp para obter um simples lfm2:1.2b. Para os outros tamanhos, substitua 1.2B por 350M, 700M ou 2.6B, e para o MoE use o repositório LiquidAI/LFM2-8B-A1B-GGUF.
Se você preferir usar o llama.cpp diretamente, o comando llama-cli aceita o mesmo repositório do Hugging Face com a opção -hf. Essa também é a opção recomendada para um servidor minimalista em uma placa ARM, onde o llama-server roda consumindo menos recursos que o Ollama.
Por fim, para um script Python com os pesos originais em bfloat16, o Transformers basta. Estime cerca de 2,5 GB de RAM para o 1,2B em bf16; em CPU, esse caminho é muito mais lento que o llama.cpp e serve apenas para desenvolvimento.
#Velocidade usando apenas a CPU: os números reais
Na CPU, dois números importam: a velocidade de prefill (tokens do prompt processados por segundo, o que determina o tempo até a primeira palavra) e a velocidade de geração (tokens produzidos por segundo). A ferramenta adequada para medi-los corretamente é o llama-bench, incluído no llama.cpp: ele isola as duas fases e repete as medições. Force o uso da CPU com -ngl 0 mesmo que haja uma GPU.
As estimativas abaixo correspondem ao que se observa com o llama.cpp em Q4_K_M, usando todos os núcleos físicos, em máquinas comuns. Elas não substituem sua própria medição: a largura de banda da memória (DDR4 versus DDR5, número de canais) faz o resultado variar em até duas vezes entre dois PCs da mesma geração.
- Notebook recente (8 núcleos, DDR5)
- LFM2-1.2B: 40 a 70 tokens/s em geração, centenas de tokens/s em prefill. O modelo de 350M ultrapassa os 100 tokens/s. O modelo de 2,6B está em torno de 25 a 40 tokens/s.
- Computador de mesa com 4 a 6 núcleos, DDR4
- LFM2-1.2B: 20 a 35 tokens/s, bem acima da velocidade de leitura. Um Qwen3-1,7B na mesma máquina cai em torno de 12 a 20 tokens/s.
- Mac Apple Silicon (apenas CPU)
- Comparável a um notebook com DDR5 graças à memória unificada; na prática, você deixará a aceleração por conta do Metal, mas o LFM2 continua confortável de usar em um MacBook Air mesmo apenas com a CPU.
- Raspberry Pi 5 (8 GB)
- LFM2-1.2B: 8 a 12 tokens/s; LFM2-350M: 25 a 35 tokens/s. É nesse cenário que a diferença em relação a um transformer clássico fica mais evidente.
- LFM2-8B-A1B
- Com 16 GB de RAM DDR5, espere de 30 a 50 tokens/s: apenas 1,5 bilhão de parâmetros trabalham por token, mas os 5 GB de pesos precisam caber na memória.
O ponto que faz a diferença no uso é o prefill. Em um transformer de 1,7B, processar um documento de 4.000 tokens na CPU leva muitas vezes entre 15 e 30 segundos até a primeira resposta; o LFM2-1.2B reduz esse tempo por um fator próximo de dois nos testes publicados pela Liquid AI, tornando um RAG local na CPU realmente utilizável, e não apenas possível.
#Para quais usos preferir o LFM2
LFM2 não é um substituto do Qwen3-8B nem do Gemma 3 12B. Em GPUs com VRAM, um transformador maior será mais inteligente, ponto. O interesse de LFM2 surge quando o hardware é a restrição: sem GPU, pouca RAM, bateria para economizar ou volume de requisições a absorver com custo constante.
- Assistente em notebook sem GPU
- Uma conversa fluida em um ultraportátil, sem que a ventoinha dispare. Os modelos de 1,2B ou 2,6B respondem mais rápido do que você consegue ler.
- Processamento em lote em servidor com CPU
- Classificar tickets, extrair campos, reescrever descrições de produtos: milhares de requisições curtas por hora em uma VM sem GPU, com o 350M ou o 700M.
- RAG local leve
- Prefill rápido + contexto de 32k: indexar notas ou documentação interna e responder na CPU em alguns segundos.
- Sistemas embarcados e automação residencial
- Raspberry Pi, mini-PC industrial, dispositivo de automação residencial: interpretar um comando de voz transcrito, gerar uma resposta curta, chamar uma ferramenta.
- Móvel
- A Liquid AI oferece seu SDK LEAP (Liquid Edge AI Platform) para iOS e Android, e a aplicação Apollo para testar os modelos no celular. Os GGUF também funcionam nas aplicações baseadas em llama.cpp.
- Chamadas de ferramentas
- As variantes instruct do LFM2 oferecem suporte nativo à chamada de funções com tags dedicadas, o que faz dele um pequeno roteador de baixo custo para agentes.
Por outro lado, mantenha um transformer clássico quando você tiver uma GPU e VRAM disponível para aproveitar, quando a tarefa exigir raciocínio longo (matemática, código complexo) ou quando você depender de um ecossistema muito amplo de modelos ajustados por fine-tuning: Qwen e Llama continuam à frente nesse campo.
#Limites e solução de problemas
- Erro « unknown model architecture: lfm2 »
- Seu motor é muito antigo. Atualize Ollama, LM Studio ou recompile o llama.cpp a partir de uma versão posterior a julho de 2025.
- Respostas que se repetem em loop
- Reduza a temperatura para 0,3 e ative min_p com o valor 0.15 e repeat_penalty com o valor 1.05, os valores recomendados pela Liquid AI. Os pequenos modelos são sensíveis às configurações padrão.
- Velocidade decepcionante
- Verifique com ollama ps se o modelo está realmente totalmente carregado, reduza o número de threads para corresponder ao número de núcleos de alto desempenho e feche os aplicativos que saturam a largura de banda da memória (por exemplo, um navegador com dezenas de abas).
- Francês incorreto
- O 350M continua limitado em francês; passe para o 1,2B ou o 2,6B, treinados com uma parcela de conteúdo multilíngue mais aproveitável.
- Quantização excessivamente agressiva
- Em um modelo de 350M ou 700M, um Q4 degrada mais a qualidade do que em um 7B. Prefira Q8_0 para os modelos menores: o arquivo continua minúsculo (menos de 800 MB para o 700M).
- Licença empresarial
- Acima do limite de faturamento estabelecido pela LFM Open License, o uso comercial exige um acordo com a Liquid AI. Verifique antes de colocar em produção.
#Para se aprofundar
O LFM2 faz especialmente sentido em uma configuração sem GPU ou em uma máquina pequena. Estes guias do site complementam este guia:
- LLM local sem GPU (CPU)
- Os modelos recomendados por quantidade de RAM e os benchmarks de tokens/s em CPU, para situar o LFM2 em relação às alternativas.
- Importar um modelo GGUF do Hugging Face para o Ollama
- Tudo sobre a sintaxe hf.co, os Modelfiles e os aliases, útil para fixar os parâmetros recomendados do LFM2.
- LLM no Raspberry Pi 5
- O caso de uso por excelência em sistemas embarcados, em que a velocidade do LFM2 faz a diferença.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.