Granite 4 da IBM localmente: instalação e casos d'usage
A IBM desenvolve discretamente uma das famílias de LLMs com pesos abertos mais interessantes para empresas: Granite. Este guia mostra como instalar o Granite 4 localmente com Ollama, explica a arquitetura híbrida Mamba que reduz a memória necessária, detalha a licença Apache 2.0 sem cláusulas com armadilhas e aborda os usos — RAG, chamadas de função, tarefas empresariais — nos quais o Granite realmente se destaca em relação aos modelos voltados ao público geral.
#Por que escolher o Granite 4 em vez de outro modelo
O Granite não foi desenvolvido para liderar os rankings de chatbots. A IBM tem um objetivo diferente: modelos confiáveis, econômicos em memória e juridicamente regulares, feitos para serem integrados a aplicações empresariais. Não escolhemos o Granite para discutir filosofia, mas para conectar um modelo a uma base documental, fazer com que ele chame ferramentas ou executá-lo a um custo menor em hardware modesto.
Três coisas distinguem o Granite 4 dos demais modelos open-weight. Primeiro, uma arquitetura híbrida Mamba que reduz bastante o consumo de memória, especialmente em contextos longos. Depois, uma licença Apache 2.0 estrita, sem as restrições de uso impostas por Llama ou Gemma. Por fim, um trabalho de rastreabilidade e governança — modelos assinados, dados de treinamento documentados, certificação ISO 42001 — que os diretores de TI e os departamentos jurídicos sabem apreciar. É um modelo pensado para passar por uma revisão de conformidade, não apenas por um benchmark.
#A arquitetura híbrida Mamba e sua economia de memória
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O verdadeiro argumento técnico do Granite 4 é sua arquitetura. Um transformer clássico depende inteiramente da atenção: a cada novo token, o modelo relê todo o contexto e armazena um «cache KV» que cresce linearmente com o comprimento da conversa. Quanto mais longo o contexto, mais o consumo de VRAM dispara e mais a inferência fica lenta. Essa é a limitação bem conhecida dos contextos longos na execução local.
Mamba pertence a uma outra família: os modelos de espaço de estados (state space models). Em vez de ler tudo de novo, uma camada Mamba mantém um estado recorrente de tamanho fixo que resume o passado. Consequência: a memória não aumenta com o comprimento do contexto e a taxa de processamento permanece estável mesmo em documentos muito longos. A limitação do Mamba usado sozinho é a recuperação menos precisa de detalhes distantes.
Granite 4 combina os dois. A maioria dos blocos são camadas Mamba-2 (econômicas), intercaladas com uma minoria de blocos de atenção (precisos) — uma proporção de aproximadamente nove camadas Mamba por uma camada de atenção. Assim, mantém-se a maior parte do ganho de memória, ao mesmo tempo que se preserva a capacidade da atenção de recuperar um detalhe exato. Na prática, Granite 4 opera com muito menos RAM/VRAM do que um transformador de tamanho semelhante, especialmente quando o contexto ultrapassa alguns milhares de tokens.
#Micro, Tiny e Small: qual variante escolher
O Granite 4 está disponível em vários tamanhos, com sufixos que indicam o hardware de destino. As versões marcadas com “H” usam a arquitetura híbrida; uma versão não híbrida é fornecida para ambientes que ainda não suportam o Mamba.
- Granite 4 Micro (~3B, denso)
- O menor, denso e híbrido. Ideal para rodar em CPU, com pouca VRAM ou em dispositivos de borda. Cabe em ~2 GB em Q4. Perfeito para extração, classificação e RAG leve.
- Granite 4 Tiny-H (~7B, MoE)
- Mistura de especialistas híbrida: muitos parâmetros no total, mas poucos ativos a cada token, portanto rápida. Bom equilíbrio entre qualidade e velocidade em uma placa de entrada.
- Granite 4 Small-H (~32B, MoE)
- Uma opção de ponta acessível: qualidade próxima à dos grandes modelos para tarefas profissionais, mantendo o baixo consumo de memória da arquitetura híbrida. Destinada a estações de trabalho ou servidores.
- Variante não híbrida
- Existe uma versão com arquitetura Transformer clássica para runtimes que ainda não oferecem suporte ao Mamba. Reservar para casos de compatibilidade — perde-se a economia de memória.
Para começar, o Micro é suficiente para validar os casos de uso e funciona em qualquer lugar. Passe para Tiny-H ou Small-H quando souber o que deseja industrializar e constatar, por meio de medições, uma insuficiência de qualidade.
#Pré-requisitos e VRAM
O único pré-requisito de software é ter o Ollama instalado e atualizado — o daemon escuta por padrão em http://localhost:11434. Certifique-se de ter uma versão recente: o suporte às camadas Mamba do Granite 4 exige uma versão suficientemente recente do Ollama; caso contrário, o modelo não será carregado.
- Micro (3B) em Q4
- ≈ 2 GB de VRAM. Também roda em CPU com 8 GB de RAM, devagar, mas de forma confiável. Uma RTX 3060 de 12 GB oferece bastante folga.
- Tiny-H (7B MoE) em Q4
- Aproximadamente 5 GB de VRAM para os pesos, mas a ativação parcial do MoE torna a inferência leve. Uma placa de 8 a 12 GB é mais do que suficiente.
- Small-H (32B MoE) em Q4
- ≈ 19 GB de VRAM. RTX 4090 de 24 GB ou Mac com memória unificada de 32–48 GB. A arquitetura híbrida limita o aumento acentuado do uso de memória em contextos longos.
- Margem para o contexto
- Graças ao Mamba, o cache KV ocupa muito menos memória do que o de um transformer equivalente: você pode trabalhar com grandes contextos sem dobrar a VRAM.
#Instalar o Granite 4 via Ollama
A instalação segue o fluxo Ollama habitual. O modelo é publicado na biblioteca oficial sob o nome granite4; as variantes são selecionadas por meio de tags. Verifique o nome exato das tags em ollama.com/library antes de baixar uma variante de tamanho específico, pois elas evoluem de uma versão para outra.
- 01Verificar OllamaConfirme que o daemon está rodando e atualizado. Uma versão antiga não conhece as camadas Mamba do Granite 4.
- 02Baixar o modeloBaixe a variante escolhida com ollama pull. Comece com Micro para testar rapidamente sem saturar seu disco nem sua placa.
- 03Iniciar um primeiro chatollama run abre uma sessão interativa. Faça uma pergunta profissional — resumo de um texto, extração de campos — em vez de uma charada genérica.
- 04Conectar uma interfaceAponte o Open WebUI ou o LM Studio para o endpoint local para um uso confortável, ou chame diretamente a API HTTP a partir da sua aplicação.
Para uso em aplicações, o Ollama expõe uma API compatível com a OpenAI na mesma porta. Assim, você pode reutilizar qualquer cliente existente apenas alterando a URL base e o nome do modelo.
#Apache 2.0, a licença sem armadilhas para empresas
É um ponto que as equipes jurídicas analisam antes dos benchmarks. O Granite 4 é publicado sob a licença Apache 2.0, uma licença de código aberto permissiva e comprovada. Você pode usá-lo comercialmente, modificá-lo, redistribuí-lo e integrá-lo a um produto fechado, sem limite de usuários nem cláusula de uso aceitável que precise ser monitorada.
Essa distinção é importante diante das alternativas populares. A « Llama Community License » da Meta não é uma verdadeira licença de código aberto: ela impõe restrições acima de 700 milhões de usuários mensais e proíbe certos usos. Os termos de uso do Gemma (Google) também regulam o uso por meio de uma política de usos proibidos. A Apache 2.0 não tem nada disso: é uma licença padrão que os departamentos jurídicos já conhecem e aprovam sem negociação.
- Uso comercial
- Autorizado sem restrição de tamanho nem de setor. Não há limite de usuários a monitorar.
- Modificação e fine-tuning
- Você pode adaptar o modelo e manter seus pesos privados, sem obrigatoriedade de publicação.
- Redistribuição
- Integração possível em produto proprietário, mantendo a menção de licença.
- Governança da IBM
- Modelos assinados criptograficamente, dados documentados e certificação ISO 42001 — argumentos concretos para uma revisão de conformidade.
#RAG e chamada de função, pontos fortes do Granite
É aqui que o Granite justifica a sua existência. A IBM treinou especificamente esses modelos para dois usos empresariais: o RAG (responder com base em documentos fornecidos) e o function calling (chamar ferramentas de forma confiável). São exatamente os componentes de que precisamos para construir um assistente empresarial útil, e não apenas um chatbot.
No RAG, o Granite segue de perto o contexto fornecido e limita as alucinações: ele tende a se basear nos trechos inseridos em vez de inventar. Isso, combinado com a arquitetura híbrida que processa documentos longos sem fazer o consumo de VRAM disparar, torna o Granite um bom motor para consultar uma base documental localmente. A versão Micro é muitas vezes suficiente, o que torna o RAG acessível em equipamentos modestos.
No uso de ferramentas, o Granite gera chamadas de função bem estruturadas e respeita os esquemas JSON esperados. Essa é a base de um agente: o modelo decide chamar uma função, lê o resultado e dá continuidade ao processo. Com isso e um contexto longo de baixo custo, é possível obter automações de negócios confiáveis sem depender da nuvem.
- RAG documental
- Ponto forte claro: bom acompanhamento do contexto, baixo índice de invenções, contexto longo com baixo consumo de memória. Ideal para uma base de conhecimento interna.
- Chamada de função
- Chamadas de ferramentas confiáveis e JSON conforme — a base dos agentes locais e das integrações com um sistema existente.
- Extração estruturada
- Transformar um texto livre em campos bem organizados (datas, valores, entidades). A versão Micro já se sai muito bem nisso.
- Conversa geral
- Respeitável, sem ser excepcional. Não é nesse aspecto que o Granite busca se destacar.
#Solução de problemas
- O modelo não carrega (erro de arquitetura)
- O seu Ollama é muito antigo para as camadas Mamba do Granite 4. Atualize o Ollama para uma versão recente e execute o pull novamente.
- « model not found » ao executar pull
- A tag não existe com esse nome. Verifique a grafia exata em ollama.com/library — as tags das variantes mudam de uma versão para outra.
- Respostas fora do assunto em RAG
- O contexto está mal formatado ou contém ruído demais. Estruture os trechos inseridos, reduza sua quantidade e peça explicitamente para responder apenas com base nos documentos fornecidos.
- Chamadas de ferramentas mal formatadas
- O esquema JSON é ambíguo. Simplifique a definição, indique explicitamente quais campos são obrigatórios e teste primeiro com uma única ferramenta antes de combinar várias.
- Queda acentuada de velocidade no Small-H
- O modelo passa a usar a RAM por falta de VRAM. « ollama ps » mostra a distribuição entre GPU e CPU. Mude para Tiny-H ou Micro, ou reduza a precisão da quantização em um nível.
- « Connection refused »
- O daemon do Ollama não está em execução. Verifique com “ollama ps” se ele está escutando em http://localhost:11434.
#Para se aprofundar
Granite se baseia em componentes já abordados no site. Estes guias dão continuidade a este guia:
- Instalar Ollama no Linux
- O pré-requisito, se o daemon ainda não estiver instalado: script de instalação, serviço systemd e configuração da GPU NVIDIA/AMD.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para equilibrar qualidade e VRAM no Granite Small-H, onde cada nível de quantização muda o que cabe na sua placa.
- IA local em empresas: RGPD, soberania e implantação
- Complemento natural da licença Apache 2.0: como implantar Granite em conformidade em uma organização.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.