Intermediário 10 minFalcon

Falcon H1 localmente: o híbrido Mamba vindo dos Emirados

O Falcon H1 é a família de modelos com pesos abertos do Technology Innovation Institute de Abu Dabi e a primeira do TII a combinar atenção clássica e camadas Mamba em cada bloco. Este guia explica o que essa arquitetura híbrida muda, qual tamanho de Falcon H1 instalar localmente de acordo com sua VRAM, como medir sua economia de memória em contextos longos e se vale a pena substituir Mistral Small ou Qwen3 na sua stack Ollama.

Por Samir K.·Atualização 2026-09-27·Testado no Windows, macOS e Linux

#Por que se interessar pelo Falcon H1

Os primeiros Falcon, em 2023, marcaram o cenário dos modelos de pesos abertos antes de serem ultrapassados por Llama, Mistral e depois Qwen. O Falcon H1, lançado em maio de 2025 pelo Technology Innovation Institute (TII) de Abu Dabi, muda de lógica: em vez de tentar acompanhar os transformers clássicos, o TII recomeça com uma arquitetura diferente, combinando atenção e modelos de espaço de estados (Mamba-2), para obter modelos compactos que se comparam favoravelmente a concorrentes duas vezes maiores.

Para uso local, o interesse está em três pontos. A linha cobre todas as configurações, desde 0,5 bilhão de parâmetros para um Raspberry Pi ou um notebook antigo até 34 bilhões para uma RTX 4090 ou um Mac com memória unificada. O contexto anunciado chega a 256.000 tokens, e a arquitetura híbrida permite realmente aproveitar esse contexto localmente, onde um transformer clássico satura a VRAM. Por fim, o Falcon H1 foi treinado nativamente em 18 idiomas, incluindo o francês e o árabe, o que o torna um candidato sério para textos em francês sem recorrer a um modelo centrado no inglês ou no chinês.

i
Falcon H1 e Falcon H1R
Este guia aborda a família Falcon H1 de base (Instruct). Falcon H1R 7B, lançado no início de 2026, é a versão treinada para raciocínio passo a passo, com a mesma arquitetura. Tudo o que se refere à instalação e à memória se aplica aos dois; apenas o comportamento na resposta difere: o H1R é mais lento porque é mais verboso.

#O híbrido atenção-Mamba em poucas palavras

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Um transformer clássico se baseia inteiramente na atenção. A cada novo token, o modelo relê todo o contexto e armazena, para cada token anterior, um par de vetores, o famoso cache KV. Essa memória cresce linearmente com o comprimento da conversa ou do documento. É ela, e não os pesos do modelo, que faz a capacidade de memória da sua placa de vídeo ser excedida quando você carrega um relatório longo.

Mamba pertence a outra família, a dos modelos de espaço de estados (state space models). Uma camada Mamba não relê o passado: ela mantém um estado recorrente de tamanho fixo que resume o que veio antes, como uma rede recorrente modernizada. A memória por token é constante, e a taxa de geração permanece estável independentemente do comprimento do contexto. A contrapartida conhecida é uma recuperação menos precisa de detalhes distantes: um modelo Mamba puro tem mais dificuldade para recuperar um número específico escondido em uma página 40.

Os híbridos buscam o melhor de ambos. Enquanto o IBM Granite 4 ou o Jamba alternam camadas Mamba e camadas de atenção, o Falcon H1 adota um esquema paralelo: em cada bloco, cabeças de atenção e cabeças Mamba-2 trabalham lado a lado na mesma entrada, e suas saídas são concatenadas antes da camada seguinte. O TII ajustou a proporção entre os dois em favor dos canais Mamba, mantendo a memória de atenção em um nível muito inferior ao de um transformer de tamanho equivalente, ao mesmo tempo que preserva atenção suficiente para recuperar um detalhe exato.

Transformer clássico (Mistral, Qwen, Llama)
100% de atenção. Qualidade máxima de recall, mas cache KV proporcional ao contexto: o consumo de VRAM dispara quando o contexto ultrapassa algumas dezenas de milhares de tokens.
Mamba puro (Falcon Mamba 7B)
Memória constante por token, muito rápido em fluxos longos. Recuperação de detalhes distantes mais fraca e suporte de software ainda desigual.
Híbrido sequencial (Granite 4, Jamba)
Camadas Mamba majoritárias, intercaladas com camadas de atenção. Bom ganho de memória, arquitetura simples de implementar nos runtimes.
Híbrido paralelo (Falcon H1)
Atenção e Mamba-2 em cada bloco, com saídas concatenadas. O modelo decide, a cada camada, o que atribui à memória precisa ou à memória comprimida.
→
O que isso muda concretamente
Com um prompt de 2.000 tokens, você não perceberá nenhuma diferença em relação a um transformador clássico. Carregue um contrato de 60 páginas ou uma conversa de três horas e a diferença se torna evidente: o Falcon H1 mantém um consumo de memória quase constante, enquanto o Mistral Small ou o Qwen3 precisam quantizar seu cache KV ou reduzir o contexto.

#Tamanhos disponíveis: de 0,5B a 34B

A TII lança o Falcon H1 em seis tamanhos, cada um com uma versão Base (pré-treinada) e uma Instruct (chat). Apenas as versões Instruct interessam a você para uso com Ollama ou LM Studio. Todas compartilham a mesma arquitetura e o mesmo tokenizer multilíngue.

Falcon H1 0.5B
O menor. Para dispositivos embarcados, um teste de pipeline ou um Raspberry Pi. Não conte com ele para uma tarefa séria de redação.
Falcon H1 1.5B
Classificação, extração simples, preenchimento automático. Roda em qualquer CPU recente com menos de 2 GB de memória.
Falcon H1 1.5B-Deep
Mesmo número de parâmetros do 1.5B, mas muito mais camadas, mais estreitas. O TII posiciona esse modelo no nível de modelos com 7 a 10 bilhões de parâmetros. É a variante a testar em um notebook sem GPU.
Falcon H1 3B
O equilíbrio para uma placa de 4 a 6 GB ou um Mac de 16 GB. Resumo, chat em francês, RAG leve.
Falcon H1 7B
O modelo intermediário da linha. Compete com o Qwen3 8B e supera os modelos de 7B da geração anterior. Uma RTX 3060 12GB consegue executá-lo com um contexto generoso.
Falcon H1 34B
O modelo topo de linha. A TII o compara com Qwen3 32B, Gemma 3 27B e Llama 4 Scout. Exige pelo menos 24 GB de VRAM em Q4, ou um Mac com 48 GB de memória unificada para funcionar com conforto.

A variante 1.5B-Deep merece um comentário. A TII apostou em um modelo estreito, mas muito profundo, com quase três vezes mais camadas do que o 1.5B padrão. O resultado é mais lento por token, pois cada camada é executada em sequência, mas claramente mais capaz. Em CPU, onde a largura de banda da memória limita tudo, é frequentemente a melhor relação entre qualidade e gigabytes de toda a linha.

#Pré-requisitos e VRAM

Quanto ao software, você precisa de uma versão recente do Ollama. O suporte à arquitetura falcon-h1 foi adicionado ao llama.cpp no verão de 2025, e o Ollama herdou esse suporte nas versões publicadas depois disso. Uma versão anterior do Ollama se recusará a carregar o modelo, exibindo um erro de arquitetura desconhecida. O daemon escuta por padrão em http://localhost:11434; o Open WebUI ou o LM Studio se conectam a ele sem configurações especiais.

0.5B e 1.5B em Q4_K_M
Menos de 1,5 GB. Apenas CPU, com 4 GB de RAM livres. Nenhuma GPU necessária.
3B em Q4_K_M
Aproximadamente 2 GB de VRAM. Qualquer placa com 4 GB ou mais, ou 8 GB de RAM em modo CPU.
7B em Q4_K_M
Aproximadamente 5 GB de VRAM para os pesos. Uma RTX 3060 12GB ou RTX 4070 12GB dá conta com folga, com margem para um contexto de 32K tokens ou mais.
7B em Q8_0
≈ 8 GB. Para uma RTX 4080 de 16 GB ou um Mac de 24 GB, se você quiser a precisão máxima na extração.
34B em Q4_K_M
≈ 20 GB. A RTX 4090 de 24GB fica no limite; é preciso monitorar o contexto. O M4 Pro de 48 GB ou o Mac Studio têm muito mais folga.
34B em Q8_0
≈ 36 GB. Reservado para Macs com 64 GB ou mais, ou para sistemas com duas GPUs.
i
Referência de quantização
Q4_K_M continua sendo o padrão recomendado, com a melhor relação entre qualidade e tamanho. Mude para Q5_K_M ou Q8_0 apenas se a VRAM permitir e se você medir uma diferença em suas tarefas. No Falcon H1, a margem liberada pelo cache KV reduzido costuma valer mais do que um nível adicional de quantização.

#Instalar o Falcon H1 localmente de acordo com sua VRAM

A TII publica arquivos GGUF oficiais para cada tamanho no Hugging Face, em repositórios chamados tiiuae/Falcon-H1-<taille>-Instruct-GGUF. O Ollama consegue baixar um GGUF diretamente do Hugging Face usando o prefixo hf.co, especificando a quantização desejada após os dois-pontos. Aproveite para verificar em ollama.com/library se apareceu uma tag oficial falcon-h1 desde a redação deste guia; se houver, prefira-a, pois ela inclui um template de chat validado.

  1. 01
    Atualizar o Ollama
    Execute novamente o instalador oficial ou seu gerenciador de pacotes e depois verifique a versão. Essa é a etapa que todo mundo pula e que explica a maioria das falhas de carregamento.
  2. 02
    Escolher o tamanho com base na VRAM
    12 GB ou menos: 7B em Q4_K_M. 4 a 6 GB: 3B. Sem GPU: 1.5B-Deep. 24 GB ou Mac com 48 GB: 34B. Não baixe modelos de vários tamanhos de uma vez; cada GGUF pesa de 1 a 20 GB.
  3. 03
    Baixar o GGUF do Hugging Face
    Use ollama pull com o caminho hf.co do repositório e a tag de quantização. O Ollama baixa o arquivo, lê seus metadados e gera o template de chat a partir deles.
  4. 04
    Iniciar uma sessão e testar em francês
    ollama run abre um chat interativo. Faça uma tarefa real, como resumir um texto ou extrair campos, em vez de uma charada. Verifique se o modelo responde em francês sem mudar para o inglês.
  5. 05
    Verificar a distribuição entre GPU e CPU
    ollama ps indica a porcentagem do modelo carregada na GPU. Se uma parte estiver na CPU, reduza o tamanho ou a quantização; caso contrário, a vazão despenca.
Terminal — Falcon H1 7B em uma placa de 12 GB
# 1. Vérifier la version d'Ollama (doit dater d'après l'été 2025)
ollama --version

# 2. Tirer le GGUF officiel TII en Q4_K_M (~4,5 Go)
ollama pull hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M

# 3. Lancer une session interactive
ollama run hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M

# 4. Vérifier que tout est sur le GPU
ollama ps
Terminal — outros tamanhos
# Sans GPU : la variante 1.5B-Deep, étroite mais très profonde
ollama pull hf.co/tiiuae/Falcon-H1-1.5B-Deep-Instruct-GGUF:Q4_K_M

# Carte 4-6 Go ou Mac 16 Go
ollama pull hf.co/tiiuae/Falcon-H1-3B-Instruct-GGUF:Q4_K_M

# RTX 4090 24 Go ou Mac 48 Go
ollama pull hf.co/tiiuae/Falcon-H1-34B-Instruct-GGUF:Q4_K_M

O nome completo com o prefixo hf.co é longo para digitar e pouco legível no Open WebUI. Crie um alias local com um Modelfile: aproveite para definir o contexto e um prompt de sistema em francês, e o modelo aparecerá com um nome curto em todas as suas interfaces.

Terminal — alias curto com Modelfile
cat > Modelfile.falcon-h1 <<'EOF'
FROM hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M
PARAMETER num_ctx 32768
PARAMETER temperature 0.3
SYSTEM "Tu es un assistant précis. Tu réponds en français, de façon concise."
EOF

ollama create falcon-h1:7b -f Modelfile.falcon-h1
ollama run falcon-h1:7b

Para uso em aplicações, o Ollama expõe sua API HTTP na mesma porta, com um endpoint compatível com a API da OpenAI. Qualquer cliente existente funciona alterando a URL base e o nome do modelo.

Terminal — chamada da API local
curl http://localhost:11434/api/chat -d '{
  "model": "falcon-h1:7b",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "options": { "num_ctx": 32768 },
  "stream": false
}'
!
Usuários do llama.cpp e LM Studio
llama.cpp carrega os mesmos GGUF com a opção -hf, por exemplo llama-server -hf tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M. LM Studio se baseia no mesmo motor: atualize antes de procurar Falcon H1 no seu catálogo, uma versão antiga não listará o arquivo como compatível.

#A vantagem medida no uso de memória em contextos longos

Essa é a promessa central do Falcon H1 executado localmente, e ela pode ser verificada em dez minutos. O protocolo é simples: carregar o mesmo modelo com dois tamanhos de contexto e comparar o uso de memória informado por ollama ps. Em um transformer clássico, passar de 8K para 64K tokens aumenta o consumo em vários gigabytes. No Falcon H1, o aumento existe, pois a parte de atenção mantém um cache KV, mas é bem menor.

Terminal — medir o custo do contexto
# Contexte 8K : noter la colonne SIZE de ollama ps
OLLAMA_CONTEXT_LENGTH=8192 ollama run falcon-h1:7b "Bonjour" && ollama ps

# Décharger, puis recharger avec 64K
ollama stop falcon-h1:7b
OLLAMA_CONTEXT_LENGTH=65536 ollama run falcon-h1:7b "Bonjour" && ollama ps

# Même exercice avec un transformeur classique pour comparer
ollama stop falcon-h1:7b
OLLAMA_CONTEXT_LENGTH=65536 ollama run qwen3:8b "Bonjour" && ollama ps

Dois esclarecimentos para interpretar os números. Primeiro, o Ollama reserva o cache KV antecipadamente para todo o contexto solicitado: a memória exibida reflete, portanto, a capacidade reservada, e não o que seu prompt realmente utiliza. Segundo, se você ativou a quantização do cache KV na configuração do Ollama, ela também se aplica à parte de atenção do Falcon H1, o que reduz ainda mais a diferença medida, mas não muda a conclusão: com a mesma VRAM, o Falcon H1 aceita um contexto muito mais longo que um transformador de mesmo tamanho.

Na prática, em uma placa de 12 GB, o Falcon H1 7B em Q4_K_M deixa espaço para um contexto de 64K tokens sem transferir parte do processamento para a CPU, enquanto o Qwen3 8B ou o Mistral 7B exigem quantizar o cache KV ou limitar o contexto a cerca de 32K. A taxa de geração, por sua vez, cai muito menos à medida que o contexto se preenche: a parte Mamba processa cada novo token em tempo constante.

!
Contexto longo não significa lembrança perfeita
Falcon H1 aceita 256K tokens, mas aceitar não é compreender. Como qualquer modelo, sua precisão diminui ao lidar com detalhes enterrados em pontos distantes do prompt, e o componente Mamba contribui para isso. Para encontrar um número exato em 200 páginas, um RAG com divisão em trechos e busca continua sendo mais confiável que um contexto gigante. O contexto longo do Falcon H1 se destaca no resumo, na síntese e no acompanhamento de conversas, mas não na busca de uma agulha no palheiro.

#Diante de Mistral Small e Qwen3: o veredicto

A pergunta que todos fazem: é necessário substituir o modelo habitual? A resposta depende do tamanho, porque a categoria em que o Falcon H1 compete varia conforme a variante.

Falcon H1 7B contra Qwen3 8B
A qualidade é comparável no geral. O Qwen3 mantém vantagem em código e raciocínio estruturado, enquanto o Falcon H1 é mais natural em francês e, principalmente, muito mais econômico quando o contexto se alonga. Para resumos de documentos e chat em francês com 12 GB, o Falcon H1 leva vantagem. Para programar, continue com o Qwen3.
Falcon H1 7B contra Mistral Small 3.2
Não são modelos da mesma categoria: Mistral Small tem 24 bilhões de parâmetros e exige de 14 a 15 GB em Q4. Se você tiver a VRAM necessária, Mistral Small continua melhor na maioria das tarefas. Falcon H1 7B é a escolha quando a placa tem 12 GB ou quando o contexto precisa ultrapassar 32K.
Falcon H1 34B contra Mistral Small 3.2
O duelo interessante. Falcon H1 34B é mais forte nos benchmarks de conhecimento e raciocínio e lida melhor com contextos muito longos, mas exige 5 GB a mais em Q4 e não tem visão. Mistral Small cabe em uma placa de 16 GB, lê imagens, está sob a licença Apache 2.0 e conta com um ecossistema mais maduro, especialmente para chamadas de função.
Falcon H1 34B contra Qwen3 32B
Com VRAM semelhante, o Qwen3 32B continua sendo a referência para código e agentes. O Falcon H1 34B é preferível para documentos longos em francês ou árabe e no Mac, onde a memória unificada acomoda seus 20 GB sem esforço.

O veredito cabe em uma frase: Falcon H1 é o melhor modelo para instalar quando seu problema é o uso de memória com contextos longos ou quando francês e árabe são suas línguas de trabalho. Ele não é o melhor modelo generalista para todas as situações e não tem a maturidade de ecossistema de Mistral ou Qwen. Em uma estação de trabalho com 24 GB, Mistral Small continua sendo a escolha segura para um assistente do dia a dia; Falcon H1 34B é o modelo que se adiciona como complemento para documentos grandes.

→
O teste certo antes de decidir
Pegue três documentos reais de sua atividade, com entre 20 e 80 páginas, e faça a mesma série de perguntas ao Falcon H1 7B e ao seu modelo atual, com o mesmo contexto. Compare a qualidade dos resumos, a fidelidade dos números citados e a velocidade indicada no final da resposta com a opção --verbose do comando ollama run. Isso é mais esclarecedor do que qualquer benchmark público.

#Licença Falcon-LLM: ler antes de implantar

O Falcon H1 é publicado sob a licença Falcon-LLM da TII. Ela é derivada da Apache 2.0 e permite uso comercial, modificação e redistribuição, mas acrescenta uma política de uso aceitável e algumas obrigações de atribuição. Não oferece a liberdade total da Apache 2.0, como a oferecida por Mistral Small ou Granite, e também não é uma licença restritiva como a do Llama, com seus limites de número de usuários.

Para uso pessoal ou interno, essa questão não se coloca. Para um produto comercial redistribuído, reserve dez minutos para ler o texto no site da TII e verificar se o seu caso não se enquadra nos usos excluídos. O catálogo do site indica a licença em cada ficha Falcon, e a versão dessa licença pode mudar de uma geração para outra.

#Solução de problemas

Erro unknown model architecture falcon-h1
Seu Ollama, LM Studio ou llama.cpp está desatualizado demais para reconhecer a arquitetura híbrida. Atualize, reinicie o daemon e execute o pull novamente. Não há outra solução alternativa: as camadas Mamba-2 não são carregadas sem suporte do mecanismo de execução.
O pull hf.co falha ou não encontra a tag
Verifique a grafia exata do repositório e da quantização na página do Hugging Face, especialmente o uso de maiúsculas e minúsculas em Q4_K_M. Se o repositório não oferecer a tag solicitada, abra a aba Files para ler a lista de arquivos GGUF disponíveis.
Respostas em inglês mesmo quando você escreve em francês
Adicione um prompt de sistema que imponha o idioma, como no Modelfile acima. O tokenizer multilíngue do Falcon H1 lida muito bem com o francês, mas o Instruct, sem uma instrução, às vezes segue o idioma dominante de seus dados.
Taxa de geração muito baixa no 34B
ollama ps provavelmente mostra uma distribuição parcial na CPU. Com 24 GB, reduza o contexto para 16K ou use Q4_K_S. No Mac, aumente o limite de memória da GPU alocável se o sistema reservar memória demais.
Uso de memória maior do que o esperado com contexto longo
É normal: o Ollama reserva o cache KV de atenção para todo o contexto declarado, mesmo vazio. Ao comparar com outro modelo, sempre use o mesmo tamanho de contexto e ative a quantização do cache KV se quiser economizar um pouco mais.
Template de chat incorreto, tags visíveis nas respostas
O Ollama gera o template a partir dos metadados do GGUF. Se aparecerem tags, baixe o GGUF oficial da TII em vez de uma conversão de terceiros, ou defina o TEMPLATE explicitamente no seu Modelfile.

#Para se aprofundar

O Falcon H1 faz pleno sentido quando você domina as noções de contexto e memória que ele utiliza. Estes guias do site complementam este:

Compreender a janela de contexto
O que representam 8K, 32K ou 256K tokens, qual é o custo em VRAM e por que o KV cache é o verdadeiro gargalo dos transformadores clássicos.
Quantizar o cache KV para economizar VRAM
O outro recurso para ampliar o contexto, que pode ser combinado com a arquitetura híbrida do Falcon H1.
Granite 4 da IBM rodando localmente
O outro híbrido Mamba do momento, com arquitetura sequencial e sob Apache 2.0. Compará-lo com o Falcon H1 ajuda a entender as escolhas da TII.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para escolher entre Q4_K_M e Q8_0 em cada tamanho de Falcon H1 de acordo com sua VRAM.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.