Intermediário 10 minEdge

LFM2 da Liquid AI: a arquitetura alternativa para l'edge

O LFM2 da Liquid AI não é apenas mais um transformer: trata-se de uma família de pequenos modelos (350M a 8B) baseada em uma arquitetura híbrida em que a maioria das camadas usa convoluções curtas, e não atenção. Resultado anunciado pela Liquid AI: decodificação e prefill cerca de duas vezes mais rápidos que os do Qwen3 de mesmo tamanho em CPU, com um consumo de memória que cresce pouco com o contexto. Este guia explica o que essa arquitetura realmente muda, como instalar o LFM2 com Ollama ou llama.cpp, qual velocidade esperar sem GPU e para quais usos essa escolha supera um transformer tradicional.

Por Thomas P.·Atualização 2026-09-24·Testado no Windows, macOS e Linux

#LFM2 da Liquid AI: por que um modelo pensado para a CPU

A Liquid AI é uma empresa originária do MIT (CSAIL), fundada em 2023 em torno das "redes neurais líquidas" e dos modelos de estado contínuo. Após uma primeira geração LFM1 fechada, a empresa publicou em julho de 2025 os pesos do LFM2, sua segunda geração, em três tamanhos: 350M, 700M e 1,2B de parâmetros. Outras variantes vieram depois (2,6B, uma versão MoE 8B-A1B, modelos de visão e áudio e, em seguida, a geração LFM2.5). O foco permanece o mesmo: esses modelos visam a execução no dispositivo, ou seja, em um telefone, um notebook sem placa de vídeo, um mini-PC ou uma placa embarcada.

Quase todos os pequenos modelos abertos que você conhece (Qwen3, Gemma 3, Llama 3.2, SmolLM) são transformers clássicos: cada camada aplica atenção a todo o contexto. Isso funciona muito bem em GPUs, mas, em CPUs, cada token gerado precisa reler um cache de chave-valor (KV cache) que cresce com a conversa, e o prefill de um prompt longo tem um custo elevado. O LFM2 aborda precisamente esses dois pontos ao substituir a maioria das camadas de atenção por blocos de convolução curta, que consomem muito menos memória e largura de banda.

Alvo
Inferência no dispositivo: CPU x86 ou ARM, NPU, GPU integrado. O GPU dedicado não é o foco principal, embora também funcione.
Promessa quantificada
A Liquid AI anuncia decodificação e prefill até 2 vezes mais rápidos que o Qwen3 em tamanho comparável no CPU (medidas publicadas em um AMD Ryzen AI 9 HX 370 e um Samsung Galaxy S24 Ultra).
Qualidade
Com o mesmo número de parâmetros, o LFM2 se posiciona no mesmo nível ou um pouco acima dos transformers concorrentes nos benchmarks de conhecimento, instruções e matemática; o 1,2B rivaliza com o Qwen3-1,7B no MMLU e no IFEval.
Licença
LFM Open License v1.0: uso comercial livre abaixo de um limite de faturamento anual (10 milhões de dólares); acima desse valor, é necessário entrar em contato com a Liquid AI. Não se trata da Apache 2.0: releia o texto antes de uma implantação em ambiente empresarial.

#O que muda com a arquitetura híbrida LFM

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

O LFM2 empilha 16 blocos. Dez são blocos de convolução de curto alcance com duas portas (double-gated short-range convolution), seis são blocos de atenção com consultas agrupadas (grouped query attention, GQA), como em um transformer moderno. A Liquid AI descreve esses blocos de convolução como operadores LIV (linear input-varying): os pesos aplicados a cada posição dependem da entrada, o que dá ao bloco uma forma de seletividade semelhante à dos modelos de espaço de estados (Mamba) ou das RNNs modernas, sem o estado recorrente complexo desses modelos.

Concretamente, um bloco de convolução só analisa alguns tokens vizinhos. Seu custo por token é constante, independentemente do contexto já gerado, e não armazena nada no cache KV. Apenas os seis blocos de atenção mantêm um cache, contra 28 ou 36 camadas em um transformer de tamanho semelhante. Duas consequências diretas no CPU:

Decodificação mais rápida
Gerar um token consiste principalmente em reler os pesos e o cache KV a partir da RAM. Com menos cache para reler, a largura de banda da memória, que é o verdadeiro gargalo de uma CPU, é melhor aproveitada.
Prefill eficaz
Processar um prompt de 4.000 tokens (um documento para RAG, um histórico de chat) custa proporcionalmente menos do que em um transformer completo, pois dez dos dezesseis blocos operam com uma janela local.
Memória estável
O consumo aumenta lentamente com o contexto: o cache KV de seis camadas continua pequeno, o que é relevante para um telefone ou uma placa com 4 ou 8 GB de RAM compartilhada.
Contexto nativo 32k
O LFM2 foi treinado com uma janela de 32.768 tokens (128k em algumas variantes mais recentes), o suficiente para resumos e RAG leves.

No treinamento, a Liquid AI usou cerca de 10.000 bilhões de tokens para a primeira geração LFM2, com uma mistura dominada pelo inglês, cerca de 20% de dados multilíngues (incluindo francês, alemão, espanhol, árabe, chinês, japonês e coreano) e um pouco de código, além de uma destilação a partir do LFM1-7B interno. É por isso que um LFM2-1,2B consegue manter uma conversa razoável em francês, o que não é garantido para todos os modelos desse tamanho.

i
Híbrido, sem revolução
LFM2 não abandona a atenção: os seis blocos GQA mantêm a capacidade de ligar dois trechos distantes do contexto. É o mesmo equilíbrio que o Jamba (Mamba + atenção) ou os recentes modelos Granite 4 da IBM, aplicado a tamanhos muito menores. A diferença está na proporção e no operador de convolução escolhido.

#Família LFM2: tamanhos e variantes

Todas as variantes compartilham a mesma arquitetura básica e o mesmo formato de chat (tags im_start/im_end no estilo ChatML). A seguir estão as relevantes para uso edge, com o tamanho aproximado do arquivo GGUF em Q4_K_M, que corresponde aproximadamente à RAM ocupada pelos pesos quando o modelo é executado na CPU.

LFM2-350M
Aproximadamente 250 MB em Q4. Classificação, extração, reescrita curta. Funciona em quase qualquer dispositivo, incluindo Raspberry Pi ou antigos notebooks.
LFM2-700M
Aproximadamente 450 MB em Q4. Um bom equilíbrio para um celular recente ou um assistente muito leve.
LFM2-1.2B
Aproximadamente 730 MB em Q4. Modelo de referência da família: chat, resumo, RAG simples, chamadas de ferramentas. É o modelo que este guia instala.
LFM2-2.6B
Aproximadamente 1,5 GB em Q4. Lançado no fim de 2025, muito mais sólido em raciocínio e em tarefas multilíngues, ainda roda com facilidade em um notebook sem GPU.
LFM2-8B-A1B
Mistura de Especialistas: 8,3B de parâmetros ao todo, aproximadamente 1,5B ativos por token. Cerca de 5 GB em Q4: é necessária a mesma quantidade de RAM de um modelo de 8B, mas a velocidade continua sendo a de um modelo pequeno.
Variantes especializadas
LFM2-VL (visão, 450M e 1,6B), LFM2-Audio e variantes com ajuste fino para extração de dados, RAG ou chamadas de ferramentas. A geração LFM2.5 (a partir de janeiro de 2026) reutiliza a arquitetura com treinamento prolongado; o catálogo do site lista suas fichas, incluindo as dos modelos de 2,6B e 7B.
→
Qual modelo escolher?
Em um notebook ou mini-PC com 8 GB de RAM: comece com o 1,2B e passe para o 2,6B se a qualidade não for suficiente. Com 16 GB: o 8B-A1B é o mais capaz e continua sendo rápido. Em um celular ou Raspberry Pi: 350M ou 700M.

#Pré-requisitos

Nada de exótico. O ponto importante é ter uma versão recente do motor de inferência: o suporte à arquitetura LFM2 foi adicionado ao llama.cpp em julho de 2025 e ao Hugging Face Transformers na versão 4.54. As versões de Ollama e de LM Studio publicadas desde então incluem esse suporte, desde que sejam atualizadas.

Máquina
Qualquer PC ou Mac recente. Um CPU com 4 núcleos e 8 GB de RAM é suficiente para o 1,2B; considere 16 GB para o 8B-A1B.
Ollama atualizado
O Ollama escuta por padrão em http://localhost:11434. Atualize-o antes de baixar o modelo: uma versão anterior ao verão de 2025 rejeitará o GGUF com um erro de arquitetura desconhecida.
Ou llama.cpp
Um binário recente (compilado ou baixado das releases do GitHub) dá acesso a llama-cli, llama-server e principalmente llama-bench para medir a velocidade.
Python opcional
Para usar os pesos originais (não quantizados) com Transformers ≥ 4.54, por exemplo, para fine-tuning ou exportação para um SDK móvel.

#Instalar e testar o LFM2 localmente

A Liquid AI publica seus modelos no Hugging Face sob a organização LiquidAI, com um repositório de pesos originais (LiquidAI/LFM2-1.2B) e um repositório GGUF já quantizado (LiquidAI/LFM2-1.2B-GGUF) para cada tamanho. O caminho mais simples é baixar diretamente esse GGUF no Ollama, sem passar por um Modelfile.

  1. 01
    Atualizar o Ollama
    No Linux, execute novamente o script de instalação oficial; no macOS e no Windows, o aplicativo se atualiza automaticamente ou pelo seu menu. Verifique com ollama --version.
  2. 02
    Baixar o GGUF do Hugging Face
    A sintaxe hf.co/organisation/dépôt:quantification funciona com qualquer repositório GGUF público. Para LFM2-1.2B em Q4_K_M, o download pesa aproximadamente 730 MB.
  3. 03
    Iniciar um primeiro chat
    ollama run abre uma sessão interativa. Faça uma pergunta em francês para verificar a qualidade do idioma antes de se aprofundar.
  4. 04
    Forçar o uso da CPU para comparar
    Se sua máquina tiver uma GPU, você pode desativá-la para esse modelo com o parâmetro num_gpu definido como 0 e observar o comportamento real usando apenas a CPU.
  5. 05
    Conectar uma interface
    O modelo aparece imediatamente em Open WebUI, LM Studio ou qualquer cliente compatível com OpenAI apontado para a porta 11434.
Terminal — Ollama
# Vérifier la version (doit être récente, été 2025 ou plus)
ollama --version

# Tirer LFM2-1.2B quantifié en Q4_K_M depuis Hugging Face
ollama pull hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M

# Premier chat
ollama run hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M

# Même chose en CPU pur, même si un GPU est présent
ollama run hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M
>>> /set parameter num_gpu 0
>>> Résume en trois phrases ce qu'est un modèle de langage.

O nome hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M é longo para digitar; crie um alias local com ollama cp para obter um simples lfm2:1.2b. Para os outros tamanhos, substitua 1.2B por 350M, 700M ou 2.6B, e para o MoE use o repositório LiquidAI/LFM2-8B-A1B-GGUF.

Terminal — aliases e API
# Alias court
ollama cp hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M lfm2:1.2b

# Appel API (compatible avec n'importe quel client Ollama)
curl http://localhost:11434/api/chat -d '{
  "model": "lfm2:1.2b",
  "messages": [{"role": "user", "content": "Explique la différence entre RAM et VRAM en deux phrases."}],
  "options": {"temperature": 0.3, "min_p": 0.15, "repeat_penalty": 1.05},
  "stream": false
}'
→
Configurações recomendadas pela Liquid AI
A ficha oficial recomenda temperature 0.3, min_p 0.15 e repetition_penalty 1.05. Com os valores padrão do Ollama (temperature 0.8), um modelo de 1,2B entra mais facilmente em loop ou foge do assunto. Defina esses três parâmetros em um Modelfile se você usa LFM2 em produção.

Se você preferir usar o llama.cpp diretamente, o comando llama-cli aceita o mesmo repositório do Hugging Face com a opção -hf. Essa também é a opção recomendada para um servidor minimalista em uma placa ARM, onde o llama-server roda consumindo menos recursos que o Ollama.

Terminal — llama.cpp
# Chat interactif, téléchargement automatique du GGUF
llama-cli -hf LiquidAI/LFM2-1.2B-GGUF:Q4_K_M -cnv \
  --temp 0.3 --min-p 0.15 --repeat-penalty 1.05 -t 8

# Serveur API OpenAI-compatible sur le port 8080
llama-server -hf LiquidAI/LFM2-1.2B-GGUF:Q4_K_M -c 8192 -t 8

Por fim, para um script Python com os pesos originais em bfloat16, o Transformers basta. Estime cerca de 2,5 GB de RAM para o 1,2B em bf16; em CPU, esse caminho é muito mais lento que o llama.cpp e serve apenas para desenvolvimento.

Python — Transformers ≥ 4.54
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2-1.2B"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="bfloat16")

messages = [{"role": "user", "content": "Qu'est-ce qu'un modèle hybride convolution + attention ?"}]
inputs = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
out = model.generate(inputs, max_new_tokens=200, do_sample=True, temperature=0.3, min_p=0.15, repetition_penalty=1.05)
print(tok.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))

#Velocidade usando apenas a CPU: os números reais

Na CPU, dois números importam: a velocidade de prefill (tokens do prompt processados por segundo, o que determina o tempo até a primeira palavra) e a velocidade de geração (tokens produzidos por segundo). A ferramenta adequada para medi-los corretamente é o llama-bench, incluído no llama.cpp: ele isola as duas fases e repete as medições. Force o uso da CPU com -ngl 0 mesmo que haja uma GPU.

Terminal — medir
# Télécharger le GGUF une fois (llama-cli -hf le met en cache) puis :
llama-bench -m ~/.cache/llama.cpp/LiquidAI_LFM2-1.2B-GGUF_LFM2-1.2B-Q4_K_M.gguf \
  -ngl 0 -t 8 -p 512 -n 128

# Sortie : une ligne pp512 (prefill) et une ligne tg128 (génération), en tokens/s

# Comparer avec un transformer de taille voisine
llama-bench -m ~/.cache/llama.cpp/Qwen_Qwen3-1.7B-GGUF_Qwen3-1.7B-Q4_K_M.gguf -ngl 0 -t 8 -p 512 -n 128

As estimativas abaixo correspondem ao que se observa com o llama.cpp em Q4_K_M, usando todos os núcleos físicos, em máquinas comuns. Elas não substituem sua própria medição: a largura de banda da memória (DDR4 versus DDR5, número de canais) faz o resultado variar em até duas vezes entre dois PCs da mesma geração.

Notebook recente (8 núcleos, DDR5)
LFM2-1.2B: 40 a 70 tokens/s em geração, centenas de tokens/s em prefill. O modelo de 350M ultrapassa os 100 tokens/s. O modelo de 2,6B está em torno de 25 a 40 tokens/s.
Computador de mesa com 4 a 6 núcleos, DDR4
LFM2-1.2B: 20 a 35 tokens/s, bem acima da velocidade de leitura. Um Qwen3-1,7B na mesma máquina cai em torno de 12 a 20 tokens/s.
Mac Apple Silicon (apenas CPU)
Comparável a um notebook com DDR5 graças à memória unificada; na prática, você deixará a aceleração por conta do Metal, mas o LFM2 continua confortável de usar em um MacBook Air mesmo apenas com a CPU.
Raspberry Pi 5 (8 GB)
LFM2-1.2B: 8 a 12 tokens/s; LFM2-350M: 25 a 35 tokens/s. É nesse cenário que a diferença em relação a um transformer clássico fica mais evidente.
LFM2-8B-A1B
Com 16 GB de RAM DDR5, espere de 30 a 50 tokens/s: apenas 1,5 bilhão de parâmetros trabalham por token, mas os 5 GB de pesos precisam caber na memória.

O ponto que faz a diferença no uso é o prefill. Em um transformer de 1,7B, processar um documento de 4.000 tokens na CPU leva muitas vezes entre 15 e 30 segundos até a primeira resposta; o LFM2-1.2B reduz esse tempo por um fator próximo de dois nos testes publicados pela Liquid AI, tornando um RAG local na CPU realmente utilizável, e não apenas possível.

!
O número de threads não é "todos os núcleos"
Em um processador híbrido (Intel Core com núcleos P e E, Apple Silicon), definir -t para o número total de núcleos lógicos muitas vezes reduz a velocidade. Teste apenas com o número de núcleos de alto desempenho (por exemplo, -t 8 em um 8P+16E) e compare: a diferença pode atingir 30 %.

#Para quais usos preferir o LFM2

LFM2 não é um substituto do Qwen3-8B nem do Gemma 3 12B. Em GPUs com VRAM, um transformador maior será mais inteligente, ponto. O interesse de LFM2 surge quando o hardware é a restrição: sem GPU, pouca RAM, bateria para economizar ou volume de requisições a absorver com custo constante.

Assistente em notebook sem GPU
Uma conversa fluida em um ultraportátil, sem que a ventoinha dispare. Os modelos de 1,2B ou 2,6B respondem mais rápido do que você consegue ler.
Processamento em lote em servidor com CPU
Classificar tickets, extrair campos, reescrever descrições de produtos: milhares de requisições curtas por hora em uma VM sem GPU, com o 350M ou o 700M.
RAG local leve
Prefill rápido + contexto de 32k: indexar notas ou documentação interna e responder na CPU em alguns segundos.
Sistemas embarcados e automação residencial
Raspberry Pi, mini-PC industrial, dispositivo de automação residencial: interpretar um comando de voz transcrito, gerar uma resposta curta, chamar uma ferramenta.
Móvel
A Liquid AI oferece seu SDK LEAP (Liquid Edge AI Platform) para iOS e Android, e a aplicação Apollo para testar os modelos no celular. Os GGUF também funcionam nas aplicações baseadas em llama.cpp.
Chamadas de ferramentas
As variantes instruct do LFM2 oferecem suporte nativo à chamada de funções com tags dedicadas, o que faz dele um pequeno roteador de baixo custo para agentes.

Por outro lado, mantenha um transformer clássico quando você tiver uma GPU e VRAM disponível para aproveitar, quando a tarefa exigir raciocínio longo (matemática, código complexo) ou quando você depender de um ecossistema muito amplo de modelos ajustados por fine-tuning: Qwen e Llama continuam à frente nesse campo.

i
E diante do SmolLM3, Gemma 3 1B ou Qwen3-0.6B ?
Com o mesmo tamanho, o LFM2 é geralmente um pouco melhor nos benchmarks e muito mais rápido no CPU. A contrapartida é a licença LFM Open License, menos permissiva que a Apache 2.0 para grandes empresas, e um ecossistema mais jovem: menos fine-tunes comunitários, menos experiências compartilhadas.

#Limites e solução de problemas

Erro « unknown model architecture: lfm2 »
Seu motor é muito antigo. Atualize Ollama, LM Studio ou recompile o llama.cpp a partir de uma versão posterior a julho de 2025.
Respostas que se repetem em loop
Reduza a temperatura para 0,3 e ative min_p com o valor 0.15 e repeat_penalty com o valor 1.05, os valores recomendados pela Liquid AI. Os pequenos modelos são sensíveis às configurações padrão.
Velocidade decepcionante
Verifique com ollama ps se o modelo está realmente totalmente carregado, reduza o número de threads para corresponder ao número de núcleos de alto desempenho e feche os aplicativos que saturam a largura de banda da memória (por exemplo, um navegador com dezenas de abas).
Francês incorreto
O 350M continua limitado em francês; passe para o 1,2B ou o 2,6B, treinados com uma parcela de conteúdo multilíngue mais aproveitável.
Quantização excessivamente agressiva
Em um modelo de 350M ou 700M, um Q4 degrada mais a qualidade do que em um 7B. Prefira Q8_0 para os modelos menores: o arquivo continua minúsculo (menos de 800 MB para o 700M).
Licença empresarial
Acima do limite de faturamento estabelecido pela LFM Open License, o uso comercial exige um acordo com a Liquid AI. Verifique antes de colocar em produção.

#Para se aprofundar

O LFM2 faz especialmente sentido em uma configuração sem GPU ou em uma máquina pequena. Estes guias do site complementam este guia:

LLM local sem GPU (CPU)
Os modelos recomendados por quantidade de RAM e os benchmarks de tokens/s em CPU, para situar o LFM2 em relação às alternativas.
Importar um modelo GGUF do Hugging Face para o Ollama
Tudo sobre a sintaxe hf.co, os Modelfiles e os aliases, útil para fixar os parâmetros recomendados do LFM2.
LLM no Raspberry Pi 5
O caso de uso por excelência em sistemas embarcados, em que a velocidade do LFM2 faz a diferença.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.