Falcon H1 localmente: o híbrido Mamba vindo dos Emirados
O Falcon H1 é a família de modelos com pesos abertos do Technology Innovation Institute de Abu Dabi e a primeira do TII a combinar atenção clássica e camadas Mamba em cada bloco. Este guia explica o que essa arquitetura híbrida muda, qual tamanho de Falcon H1 instalar localmente de acordo com sua VRAM, como medir sua economia de memória em contextos longos e se vale a pena substituir Mistral Small ou Qwen3 na sua stack Ollama.
#Por que se interessar pelo Falcon H1
Os primeiros Falcon, em 2023, marcaram o cenário dos modelos de pesos abertos antes de serem ultrapassados por Llama, Mistral e depois Qwen. O Falcon H1, lançado em maio de 2025 pelo Technology Innovation Institute (TII) de Abu Dabi, muda de lógica: em vez de tentar acompanhar os transformers clássicos, o TII recomeça com uma arquitetura diferente, combinando atenção e modelos de espaço de estados (Mamba-2), para obter modelos compactos que se comparam favoravelmente a concorrentes duas vezes maiores.
Para uso local, o interesse está em três pontos. A linha cobre todas as configurações, desde 0,5 bilhão de parâmetros para um Raspberry Pi ou um notebook antigo até 34 bilhões para uma RTX 4090 ou um Mac com memória unificada. O contexto anunciado chega a 256.000 tokens, e a arquitetura híbrida permite realmente aproveitar esse contexto localmente, onde um transformer clássico satura a VRAM. Por fim, o Falcon H1 foi treinado nativamente em 18 idiomas, incluindo o francês e o árabe, o que o torna um candidato sério para textos em francês sem recorrer a um modelo centrado no inglês ou no chinês.
#O híbrido atenção-Mamba em poucas palavras
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Um transformer clássico se baseia inteiramente na atenção. A cada novo token, o modelo relê todo o contexto e armazena, para cada token anterior, um par de vetores, o famoso cache KV. Essa memória cresce linearmente com o comprimento da conversa ou do documento. É ela, e não os pesos do modelo, que faz a capacidade de memória da sua placa de vídeo ser excedida quando você carrega um relatório longo.
Mamba pertence a outra família, a dos modelos de espaço de estados (state space models). Uma camada Mamba não relê o passado: ela mantém um estado recorrente de tamanho fixo que resume o que veio antes, como uma rede recorrente modernizada. A memória por token é constante, e a taxa de geração permanece estável independentemente do comprimento do contexto. A contrapartida conhecida é uma recuperação menos precisa de detalhes distantes: um modelo Mamba puro tem mais dificuldade para recuperar um número específico escondido em uma página 40.
Os híbridos buscam o melhor de ambos. Enquanto o IBM Granite 4 ou o Jamba alternam camadas Mamba e camadas de atenção, o Falcon H1 adota um esquema paralelo: em cada bloco, cabeças de atenção e cabeças Mamba-2 trabalham lado a lado na mesma entrada, e suas saídas são concatenadas antes da camada seguinte. O TII ajustou a proporção entre os dois em favor dos canais Mamba, mantendo a memória de atenção em um nível muito inferior ao de um transformer de tamanho equivalente, ao mesmo tempo que preserva atenção suficiente para recuperar um detalhe exato.
- Transformer clássico (Mistral, Qwen, Llama)
- 100% de atenção. Qualidade máxima de recall, mas cache KV proporcional ao contexto: o consumo de VRAM dispara quando o contexto ultrapassa algumas dezenas de milhares de tokens.
- Mamba puro (Falcon Mamba 7B)
- Memória constante por token, muito rápido em fluxos longos. Recuperação de detalhes distantes mais fraca e suporte de software ainda desigual.
- Híbrido sequencial (Granite 4, Jamba)
- Camadas Mamba majoritárias, intercaladas com camadas de atenção. Bom ganho de memória, arquitetura simples de implementar nos runtimes.
- Híbrido paralelo (Falcon H1)
- Atenção e Mamba-2 em cada bloco, com saídas concatenadas. O modelo decide, a cada camada, o que atribui à memória precisa ou à memória comprimida.
#Tamanhos disponíveis: de 0,5B a 34B
A TII lança o Falcon H1 em seis tamanhos, cada um com uma versão Base (pré-treinada) e uma Instruct (chat). Apenas as versões Instruct interessam a você para uso com Ollama ou LM Studio. Todas compartilham a mesma arquitetura e o mesmo tokenizer multilíngue.
- Falcon H1 0.5B
- O menor. Para dispositivos embarcados, um teste de pipeline ou um Raspberry Pi. Não conte com ele para uma tarefa séria de redação.
- Falcon H1 1.5B
- Classificação, extração simples, preenchimento automático. Roda em qualquer CPU recente com menos de 2 GB de memória.
- Falcon H1 1.5B-Deep
- Mesmo número de parâmetros do 1.5B, mas muito mais camadas, mais estreitas. O TII posiciona esse modelo no nível de modelos com 7 a 10 bilhões de parâmetros. É a variante a testar em um notebook sem GPU.
- Falcon H1 3B
- O equilíbrio para uma placa de 4 a 6 GB ou um Mac de 16 GB. Resumo, chat em francês, RAG leve.
- Falcon H1 7B
- O modelo intermediário da linha. Compete com o Qwen3 8B e supera os modelos de 7B da geração anterior. Uma RTX 3060 12GB consegue executá-lo com um contexto generoso.
- Falcon H1 34B
- O modelo topo de linha. A TII o compara com Qwen3 32B, Gemma 3 27B e Llama 4 Scout. Exige pelo menos 24 GB de VRAM em Q4, ou um Mac com 48 GB de memória unificada para funcionar com conforto.
A variante 1.5B-Deep merece um comentário. A TII apostou em um modelo estreito, mas muito profundo, com quase três vezes mais camadas do que o 1.5B padrão. O resultado é mais lento por token, pois cada camada é executada em sequência, mas claramente mais capaz. Em CPU, onde a largura de banda da memória limita tudo, é frequentemente a melhor relação entre qualidade e gigabytes de toda a linha.
#Pré-requisitos e VRAM
Quanto ao software, você precisa de uma versão recente do Ollama. O suporte à arquitetura falcon-h1 foi adicionado ao llama.cpp no verão de 2025, e o Ollama herdou esse suporte nas versões publicadas depois disso. Uma versão anterior do Ollama se recusará a carregar o modelo, exibindo um erro de arquitetura desconhecida. O daemon escuta por padrão em http://localhost:11434; o Open WebUI ou o LM Studio se conectam a ele sem configurações especiais.
- 0.5B e 1.5B em Q4_K_M
- Menos de 1,5 GB. Apenas CPU, com 4 GB de RAM livres. Nenhuma GPU necessária.
- 3B em Q4_K_M
- Aproximadamente 2 GB de VRAM. Qualquer placa com 4 GB ou mais, ou 8 GB de RAM em modo CPU.
- 7B em Q4_K_M
- Aproximadamente 5 GB de VRAM para os pesos. Uma RTX 3060 12GB ou RTX 4070 12GB dá conta com folga, com margem para um contexto de 32K tokens ou mais.
- 7B em Q8_0
- ≈ 8 GB. Para uma RTX 4080 de 16 GB ou um Mac de 24 GB, se você quiser a precisão máxima na extração.
- 34B em Q4_K_M
- ≈ 20 GB. A RTX 4090 de 24GB fica no limite; é preciso monitorar o contexto. O M4 Pro de 48 GB ou o Mac Studio têm muito mais folga.
- 34B em Q8_0
- ≈ 36 GB. Reservado para Macs com 64 GB ou mais, ou para sistemas com duas GPUs.
#Instalar o Falcon H1 localmente de acordo com sua VRAM
A TII publica arquivos GGUF oficiais para cada tamanho no Hugging Face, em repositórios chamados tiiuae/Falcon-H1-<taille>-Instruct-GGUF. O Ollama consegue baixar um GGUF diretamente do Hugging Face usando o prefixo hf.co, especificando a quantização desejada após os dois-pontos. Aproveite para verificar em ollama.com/library se apareceu uma tag oficial falcon-h1 desde a redação deste guia; se houver, prefira-a, pois ela inclui um template de chat validado.
- 01Atualizar o OllamaExecute novamente o instalador oficial ou seu gerenciador de pacotes e depois verifique a versão. Essa é a etapa que todo mundo pula e que explica a maioria das falhas de carregamento.
- 02Escolher o tamanho com base na VRAM12 GB ou menos: 7B em Q4_K_M. 4 a 6 GB: 3B. Sem GPU: 1.5B-Deep. 24 GB ou Mac com 48 GB: 34B. Não baixe modelos de vários tamanhos de uma vez; cada GGUF pesa de 1 a 20 GB.
- 03Baixar o GGUF do Hugging FaceUse ollama pull com o caminho hf.co do repositório e a tag de quantização. O Ollama baixa o arquivo, lê seus metadados e gera o template de chat a partir deles.
- 04Iniciar uma sessão e testar em francêsollama run abre um chat interativo. Faça uma tarefa real, como resumir um texto ou extrair campos, em vez de uma charada. Verifique se o modelo responde em francês sem mudar para o inglês.
- 05Verificar a distribuição entre GPU e CPUollama ps indica a porcentagem do modelo carregada na GPU. Se uma parte estiver na CPU, reduza o tamanho ou a quantização; caso contrário, a vazão despenca.
O nome completo com o prefixo hf.co é longo para digitar e pouco legível no Open WebUI. Crie um alias local com um Modelfile: aproveite para definir o contexto e um prompt de sistema em francês, e o modelo aparecerá com um nome curto em todas as suas interfaces.
Para uso em aplicações, o Ollama expõe sua API HTTP na mesma porta, com um endpoint compatível com a API da OpenAI. Qualquer cliente existente funciona alterando a URL base e o nome do modelo.
#A vantagem medida no uso de memória em contextos longos
Essa é a promessa central do Falcon H1 executado localmente, e ela pode ser verificada em dez minutos. O protocolo é simples: carregar o mesmo modelo com dois tamanhos de contexto e comparar o uso de memória informado por ollama ps. Em um transformer clássico, passar de 8K para 64K tokens aumenta o consumo em vários gigabytes. No Falcon H1, o aumento existe, pois a parte de atenção mantém um cache KV, mas é bem menor.
Dois esclarecimentos para interpretar os números. Primeiro, o Ollama reserva o cache KV antecipadamente para todo o contexto solicitado: a memória exibida reflete, portanto, a capacidade reservada, e não o que seu prompt realmente utiliza. Segundo, se você ativou a quantização do cache KV na configuração do Ollama, ela também se aplica à parte de atenção do Falcon H1, o que reduz ainda mais a diferença medida, mas não muda a conclusão: com a mesma VRAM, o Falcon H1 aceita um contexto muito mais longo que um transformador de mesmo tamanho.
Na prática, em uma placa de 12 GB, o Falcon H1 7B em Q4_K_M deixa espaço para um contexto de 64K tokens sem transferir parte do processamento para a CPU, enquanto o Qwen3 8B ou o Mistral 7B exigem quantizar o cache KV ou limitar o contexto a cerca de 32K. A taxa de geração, por sua vez, cai muito menos à medida que o contexto se preenche: a parte Mamba processa cada novo token em tempo constante.
#Diante de Mistral Small e Qwen3: o veredicto
A pergunta que todos fazem: é necessário substituir o modelo habitual? A resposta depende do tamanho, porque a categoria em que o Falcon H1 compete varia conforme a variante.
- Falcon H1 7B contra Qwen3 8B
- A qualidade é comparável no geral. O Qwen3 mantém vantagem em código e raciocínio estruturado, enquanto o Falcon H1 é mais natural em francês e, principalmente, muito mais econômico quando o contexto se alonga. Para resumos de documentos e chat em francês com 12 GB, o Falcon H1 leva vantagem. Para programar, continue com o Qwen3.
- Falcon H1 7B contra Mistral Small 3.2
- Não são modelos da mesma categoria: Mistral Small tem 24 bilhões de parâmetros e exige de 14 a 15 GB em Q4. Se você tiver a VRAM necessária, Mistral Small continua melhor na maioria das tarefas. Falcon H1 7B é a escolha quando a placa tem 12 GB ou quando o contexto precisa ultrapassar 32K.
- Falcon H1 34B contra Mistral Small 3.2
- O duelo interessante. Falcon H1 34B é mais forte nos benchmarks de conhecimento e raciocínio e lida melhor com contextos muito longos, mas exige 5 GB a mais em Q4 e não tem visão. Mistral Small cabe em uma placa de 16 GB, lê imagens, está sob a licença Apache 2.0 e conta com um ecossistema mais maduro, especialmente para chamadas de função.
- Falcon H1 34B contra Qwen3 32B
- Com VRAM semelhante, o Qwen3 32B continua sendo a referência para código e agentes. O Falcon H1 34B é preferível para documentos longos em francês ou árabe e no Mac, onde a memória unificada acomoda seus 20 GB sem esforço.
O veredito cabe em uma frase: Falcon H1 é o melhor modelo para instalar quando seu problema é o uso de memória com contextos longos ou quando francês e árabe são suas línguas de trabalho. Ele não é o melhor modelo generalista para todas as situações e não tem a maturidade de ecossistema de Mistral ou Qwen. Em uma estação de trabalho com 24 GB, Mistral Small continua sendo a escolha segura para um assistente do dia a dia; Falcon H1 34B é o modelo que se adiciona como complemento para documentos grandes.
#Licença Falcon-LLM: ler antes de implantar
O Falcon H1 é publicado sob a licença Falcon-LLM da TII. Ela é derivada da Apache 2.0 e permite uso comercial, modificação e redistribuição, mas acrescenta uma política de uso aceitável e algumas obrigações de atribuição. Não oferece a liberdade total da Apache 2.0, como a oferecida por Mistral Small ou Granite, e também não é uma licença restritiva como a do Llama, com seus limites de número de usuários.
Para uso pessoal ou interno, essa questão não se coloca. Para um produto comercial redistribuído, reserve dez minutos para ler o texto no site da TII e verificar se o seu caso não se enquadra nos usos excluídos. O catálogo do site indica a licença em cada ficha Falcon, e a versão dessa licença pode mudar de uma geração para outra.
#Solução de problemas
- Erro unknown model architecture falcon-h1
- Seu Ollama, LM Studio ou llama.cpp está desatualizado demais para reconhecer a arquitetura híbrida. Atualize, reinicie o daemon e execute o pull novamente. Não há outra solução alternativa: as camadas Mamba-2 não são carregadas sem suporte do mecanismo de execução.
- O pull hf.co falha ou não encontra a tag
- Verifique a grafia exata do repositório e da quantização na página do Hugging Face, especialmente o uso de maiúsculas e minúsculas em Q4_K_M. Se o repositório não oferecer a tag solicitada, abra a aba Files para ler a lista de arquivos GGUF disponíveis.
- Respostas em inglês mesmo quando você escreve em francês
- Adicione um prompt de sistema que imponha o idioma, como no Modelfile acima. O tokenizer multilíngue do Falcon H1 lida muito bem com o francês, mas o Instruct, sem uma instrução, às vezes segue o idioma dominante de seus dados.
- Taxa de geração muito baixa no 34B
- ollama ps provavelmente mostra uma distribuição parcial na CPU. Com 24 GB, reduza o contexto para 16K ou use Q4_K_S. No Mac, aumente o limite de memória da GPU alocável se o sistema reservar memória demais.
- Uso de memória maior do que o esperado com contexto longo
- É normal: o Ollama reserva o cache KV de atenção para todo o contexto declarado, mesmo vazio. Ao comparar com outro modelo, sempre use o mesmo tamanho de contexto e ative a quantização do cache KV se quiser economizar um pouco mais.
- Template de chat incorreto, tags visíveis nas respostas
- O Ollama gera o template a partir dos metadados do GGUF. Se aparecerem tags, baixe o GGUF oficial da TII em vez de uma conversão de terceiros, ou defina o TEMPLATE explicitamente no seu Modelfile.
#Para se aprofundar
O Falcon H1 faz pleno sentido quando você domina as noções de contexto e memória que ele utiliza. Estes guias do site complementam este:
- Compreender a janela de contexto
- O que representam 8K, 32K ou 256K tokens, qual é o custo em VRAM e por que o KV cache é o verdadeiro gargalo dos transformadores clássicos.
- Quantizar o cache KV para economizar VRAM
- O outro recurso para ampliar o contexto, que pode ser combinado com a arquitetura híbrida do Falcon H1.
- Granite 4 da IBM rodando localmente
- O outro híbrido Mamba do momento, com arquitetura sequencial e sob Apache 2.0. Compará-lo com o Falcon H1 ajuda a entender as escolhas da TII.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para escolher entre Q4_K_M e Q8_0 em cada tamanho de Falcon H1 de acordo com sua VRAM.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.