Intermediário 10 minIBM

Granite 4 da IBM localmente: instalação e casos d'usage

A IBM desenvolve discretamente uma das famílias de LLMs com pesos abertos mais interessantes para empresas: Granite. Este guia mostra como instalar o Granite 4 localmente com Ollama, explica a arquitetura híbrida Mamba que reduz a memória necessária, detalha a licença Apache 2.0 sem cláusulas com armadilhas e aborda os usos — RAG, chamadas de função, tarefas empresariais — nos quais o Granite realmente se destaca em relação aos modelos voltados ao público geral.

Por Clara M.·Atualização 2026-07-30·Testado no Windows, macOS e Linux

#Por que escolher o Granite 4 em vez de outro modelo

O Granite não foi desenvolvido para liderar os rankings de chatbots. A IBM tem um objetivo diferente: modelos confiáveis, econômicos em memória e juridicamente regulares, feitos para serem integrados a aplicações empresariais. Não escolhemos o Granite para discutir filosofia, mas para conectar um modelo a uma base documental, fazer com que ele chame ferramentas ou executá-lo a um custo menor em hardware modesto.

Três coisas distinguem o Granite 4 dos demais modelos open-weight. Primeiro, uma arquitetura híbrida Mamba que reduz bastante o consumo de memória, especialmente em contextos longos. Depois, uma licença Apache 2.0 estrita, sem as restrições de uso impostas por Llama ou Gemma. Por fim, um trabalho de rastreabilidade e governança — modelos assinados, dados de treinamento documentados, certificação ISO 42001 — que os diretores de TI e os departamentos jurídicos sabem apreciar. É um modelo pensado para passar por uma revisão de conformidade, não apenas por um benchmark.

i
Granite visa a integração, não a conversa
Se você procura o melhor assistente geral em francês, Qwen3 ou Mistral continuarão frequentemente à frente. Granite brilha quando se torna um componente: motor de RAG, orquestrador de ferramentas, extrator de dados estruturados em um pipeline.

#A arquitetura híbrida Mamba e sua economia de memória

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

O verdadeiro argumento técnico do Granite 4 é sua arquitetura. Um transformer clássico depende inteiramente da atenção: a cada novo token, o modelo relê todo o contexto e armazena um «cache KV» que cresce linearmente com o comprimento da conversa. Quanto mais longo o contexto, mais o consumo de VRAM dispara e mais a inferência fica lenta. Essa é a limitação bem conhecida dos contextos longos na execução local.

Mamba pertence a uma outra família: os modelos de espaço de estados (state space models). Em vez de ler tudo de novo, uma camada Mamba mantém um estado recorrente de tamanho fixo que resume o passado. Consequência: a memória não aumenta com o comprimento do contexto e a taxa de processamento permanece estável mesmo em documentos muito longos. A limitação do Mamba usado sozinho é a recuperação menos precisa de detalhes distantes.

Granite 4 combina os dois. A maioria dos blocos são camadas Mamba-2 (econômicas), intercaladas com uma minoria de blocos de atenção (precisos) — uma proporção de aproximadamente nove camadas Mamba por uma camada de atenção. Assim, mantém-se a maior parte do ganho de memória, ao mesmo tempo que se preserva a capacidade da atenção de recuperar um detalhe exato. Na prática, Granite 4 opera com muito menos RAM/VRAM do que um transformador de tamanho semelhante, especialmente quando o contexto ultrapassa alguns milhares de tokens.

→
O ganho é máximo em contexto longo
Com um prompt curto, a diferença em relação a um Transformer convencional é modesta. Mas carregue um documento grande ou uma conversa longa e a diferença aumenta: onde um modelo convencional satura sua placa, o Granite mantém um consumo de memória quase constante.

#Micro, Tiny e Small: qual variante escolher

O Granite 4 está disponível em vários tamanhos, com sufixos que indicam o hardware de destino. As versões marcadas com “H” usam a arquitetura híbrida; uma versão não híbrida é fornecida para ambientes que ainda não suportam o Mamba.

Granite 4 Micro (~3B, denso)
O menor, denso e híbrido. Ideal para rodar em CPU, com pouca VRAM ou em dispositivos de borda. Cabe em ~2 GB em Q4. Perfeito para extração, classificação e RAG leve.
Granite 4 Tiny-H (~7B, MoE)
Mistura de especialistas híbrida: muitos parâmetros no total, mas poucos ativos a cada token, portanto rápida. Bom equilíbrio entre qualidade e velocidade em uma placa de entrada.
Granite 4 Small-H (~32B, MoE)
Uma opção de ponta acessível: qualidade próxima à dos grandes modelos para tarefas profissionais, mantendo o baixo consumo de memória da arquitetura híbrida. Destinada a estações de trabalho ou servidores.
Variante não híbrida
Existe uma versão com arquitetura Transformer clássica para runtimes que ainda não oferecem suporte ao Mamba. Reservar para casos de compatibilidade — perde-se a economia de memória.

Para começar, o Micro é suficiente para validar os casos de uso e funciona em qualquer lugar. Passe para Tiny-H ou Small-H quando souber o que deseja industrializar e constatar, por meio de medições, uma insuficiência de qualidade.

#Pré-requisitos e VRAM

O único pré-requisito de software é ter o Ollama instalado e atualizado — o daemon escuta por padrão em http://localhost:11434. Certifique-se de ter uma versão recente: o suporte às camadas Mamba do Granite 4 exige uma versão suficientemente recente do Ollama; caso contrário, o modelo não será carregado.

Micro (3B) em Q4
≈ 2 GB de VRAM. Também roda em CPU com 8 GB de RAM, devagar, mas de forma confiável. Uma RTX 3060 de 12 GB oferece bastante folga.
Tiny-H (7B MoE) em Q4
Aproximadamente 5 GB de VRAM para os pesos, mas a ativação parcial do MoE torna a inferência leve. Uma placa de 8 a 12 GB é mais do que suficiente.
Small-H (32B MoE) em Q4
≈ 19 GB de VRAM. RTX 4090 de 24 GB ou Mac com memória unificada de 32–48 GB. A arquitetura híbrida limita o aumento acentuado do uso de memória em contextos longos.
Margem para o contexto
Graças ao Mamba, o cache KV ocupa muito menos memória do que o de um transformer equivalente: você pode trabalhar com grandes contextos sem dobrar a VRAM.
i
Referência para quantização
Q4_K_M continua sendo a opção padrão recomendada (melhor relação qualidade/tamanho). Passe para Q5_K_M ou Q8_0 se tiver margem de VRAM e buscar a máxima precisão em tarefas de extração sensíveis.

#Instalar o Granite 4 via Ollama

A instalação segue o fluxo Ollama habitual. O modelo é publicado na biblioteca oficial sob o nome granite4; as variantes são selecionadas por meio de tags. Verifique o nome exato das tags em ollama.com/library antes de baixar uma variante de tamanho específico, pois elas evoluem de uma versão para outra.

  1. 01
    Verificar Ollama
    Confirme que o daemon está rodando e atualizado. Uma versão antiga não conhece as camadas Mamba do Granite 4.
  2. 02
    Baixar o modelo
    Baixe a variante escolhida com ollama pull. Comece com Micro para testar rapidamente sem saturar seu disco nem sua placa.
  3. 03
    Iniciar um primeiro chat
    ollama run abre uma sessão interativa. Faça uma pergunta profissional — resumo de um texto, extração de campos — em vez de uma charada genérica.
  4. 04
    Conectar uma interface
    Aponte o Open WebUI ou o LM Studio para o endpoint local para um uso confortável, ou chame diretamente a API HTTP a partir da sua aplicação.
Terminal — instalar e iniciar o Granite 4
# Vérifier la version d'Ollama (doit être récente)
ollama --version

# Tirer la variante Micro (la plus légère)
ollama pull granite4:micro

# Lancer une session interactive
ollama run granite4:micro

# Vérifier ce qui tourne et la répartition GPU/CPU
ollama ps

Para uso em aplicações, o Ollama expõe uma API compatível com a OpenAI na mesma porta. Assim, você pode reutilizar qualquer cliente existente apenas alterando a URL base e o nome do modelo.

Terminal — chamada da API local
curl http://localhost:11434/api/chat -d '{
  "model": "granite4:micro",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "stream": false
}'

#Apache 2.0, a licença sem armadilhas para empresas

É um ponto que as equipes jurídicas analisam antes dos benchmarks. O Granite 4 é publicado sob a licença Apache 2.0, uma licença de código aberto permissiva e comprovada. Você pode usá-lo comercialmente, modificá-lo, redistribuí-lo e integrá-lo a um produto fechado, sem limite de usuários nem cláusula de uso aceitável que precise ser monitorada.

Essa distinção é importante diante das alternativas populares. A « Llama Community License » da Meta não é uma verdadeira licença de código aberto: ela impõe restrições acima de 700 milhões de usuários mensais e proíbe certos usos. Os termos de uso do Gemma (Google) também regulam o uso por meio de uma política de usos proibidos. A Apache 2.0 não tem nada disso: é uma licença padrão que os departamentos jurídicos já conhecem e aprovam sem negociação.

Uso comercial
Autorizado sem restrição de tamanho nem de setor. Não há limite de usuários a monitorar.
Modificação e fine-tuning
Você pode adaptar o modelo e manter seus pesos privados, sem obrigatoriedade de publicação.
Redistribuição
Integração possível em produto proprietário, mantendo a menção de licença.
Governança da IBM
Modelos assinados criptograficamente, dados documentados e certificação ISO 42001 — argumentos concretos para uma revisão de conformidade.
!
Verifique sempre a licença da variante
A licença Apache 2.0 cobre a família principal Granite 4, mas um fine-tune de terceiros redistribuído no Ollama pode estar sujeito a outros termos. Verifique a ficha do modelo antes de implantá-lo em produção.

#RAG e chamada de função, pontos fortes do Granite

É aqui que o Granite justifica a sua existência. A IBM treinou especificamente esses modelos para dois usos empresariais: o RAG (responder com base em documentos fornecidos) e o function calling (chamar ferramentas de forma confiável). São exatamente os componentes de que precisamos para construir um assistente empresarial útil, e não apenas um chatbot.

No RAG, o Granite segue de perto o contexto fornecido e limita as alucinações: ele tende a se basear nos trechos inseridos em vez de inventar. Isso, combinado com a arquitetura híbrida que processa documentos longos sem fazer o consumo de VRAM disparar, torna o Granite um bom motor para consultar uma base documental localmente. A versão Micro é muitas vezes suficiente, o que torna o RAG acessível em equipamentos modestos.

No uso de ferramentas, o Granite gera chamadas de função bem estruturadas e respeita os esquemas JSON esperados. Essa é a base de um agente: o modelo decide chamar uma função, lê o resultado e dá continuidade ao processo. Com isso e um contexto longo de baixo custo, é possível obter automações de negócios confiáveis sem depender da nuvem.

RAG documental
Ponto forte claro: bom acompanhamento do contexto, baixo índice de invenções, contexto longo com baixo consumo de memória. Ideal para uma base de conhecimento interna.
Chamada de função
Chamadas de ferramentas confiáveis e JSON conforme — a base dos agentes locais e das integrações com um sistema existente.
Extração estruturada
Transformar um texto livre em campos bem organizados (datas, valores, entidades). A versão Micro já se sai muito bem nisso.
Conversa geral
Respeitável, sem ser excepcional. Não é nesse aspecto que o Granite busca se destacar.
Exemplo — definição de uma ferramenta para chamada de função
{
  "type": "function",
  "function": {
    "name": "chercher_facture",
    "description": "Récupère une facture par son numéro",
    "parameters": {
      "type": "object",
      "properties": {
        "numero": { "type": "string", "description": "Numéro de facture" }
      },
      "required": ["numero"]
    }
  }
}

#Solução de problemas

O modelo não carrega (erro de arquitetura)
O seu Ollama é muito antigo para as camadas Mamba do Granite 4. Atualize o Ollama para uma versão recente e execute o pull novamente.
« model not found » ao executar pull
A tag não existe com esse nome. Verifique a grafia exata em ollama.com/library — as tags das variantes mudam de uma versão para outra.
Respostas fora do assunto em RAG
O contexto está mal formatado ou contém ruído demais. Estruture os trechos inseridos, reduza sua quantidade e peça explicitamente para responder apenas com base nos documentos fornecidos.
Chamadas de ferramentas mal formatadas
O esquema JSON é ambíguo. Simplifique a definição, indique explicitamente quais campos são obrigatórios e teste primeiro com uma única ferramenta antes de combinar várias.
Queda acentuada de velocidade no Small-H
O modelo passa a usar a RAM por falta de VRAM. « ollama ps » mostra a distribuição entre GPU e CPU. Mude para Tiny-H ou Micro, ou reduza a precisão da quantização em um nível.
« Connection refused »
O daemon do Ollama não está em execução. Verifique com “ollama ps” se ele está escutando em http://localhost:11434.

#Para se aprofundar

Granite se baseia em componentes já abordados no site. Estes guias dão continuidade a este guia:

Instalar Ollama no Linux
O pré-requisito, se o daemon ainda não estiver instalado: script de instalação, serviço systemd e configuração da GPU NVIDIA/AMD.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para equilibrar qualidade e VRAM no Granite Small-H, onde cada nível de quantização muda o que cabe na sua placa.
IA local em empresas: RGPD, soberania e implantação
Complemento natural da licença Apache 2.0: como implantar Granite em conformidade em uma organização.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.