GLM-5 localmente com Ollama: o concorrente open-weights
GLM-5 é a nova família de pesos abertos da Zhipu AI (Universidade de Tsinghua). Versões 9B e 32B, licença permissiva, raciocínio sólido, francês correto e desempenho respeitável em código. Este guia mostra como instalar o GLM-5 localmente com Ollama, mede o desempenho real nas RTX 4070 e 4090 e o compara com Qwen3-32B e DeepSeek V3.2 nas mesmas tarefas.
#Por que o GLM-5?
O GLM-5 não tem a fama de Qwen3 ou DeepSeek, mas é um dos modelos chineses com pesos abertos mais completos lançados nos últimos meses. A versão 9B é voltada para configurações modestas (12 GB de VRAM são suficientes), enquanto a versão 32B é destinada à RTX 4090 e ao Mac Studio. No papel, ele alega pontuações próximas às do GPT-4o-mini em MMLU e HumanEval, com o mesmo tamanho que o Qwen3-32B.
Na prática, GLM-5 se destaca em três aspectos: o raciocínio estruturado (modo thinking semelhante ao do Qwen3), o francês (sensivelmente melhor que o Qwen3-9B em prompts complexos) e o código Python. Os pontos em que decepciona: a janela de contexto fica limitada a 128k em execução local, apesar da promessa de 1M, e a visão não está integrada (diferentemente do GLM-4V).
#Pré-requisitos de hardware
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- GLM-5 9B Q4_K_M
- ≈ 5,5 GB de VRAM. RTX 3060 12 GB, RTX 4060 8 GB (offload parcial), Mac M2 com 16 GB de memória unificada, todas as RTX 4070+.
- GLM-5 32B Q4_K_M
- ≈ 19 GB de VRAM. Uma RTX 4090 de 24 GB dá conta com folga, assim como uma RTX 3090 de 24 GB. Com 16 GB (4080), é preciso passar para Q3_K_M.
- GLM-5 32B Q5_K_M
- ≈ 22-23 GB de VRAM. Cabe na RTX 4090, mas com pouca margem. Prefira Q4_K_M se ativar um contexto longo.
- Ollama 0.6.0+
- O suporte ao GLM-5 foi adicionado progressivamente. É necessária uma versão recente para o tokenizer e o template de chat.
- Disco
- Reserve de 6 GB (9B Q4) a 23 GB (32B Q5). Mais se você mantiver várias quantizações em paralelo.
#1. Baixar o modelo do Hugging Face
A Zhipu AI publica os pesos oficiais no Hugging Face sob a organização THUDM. Dois repositórios são relevantes para você:
Esses repositórios contêm os pesos no formato safetensors (FP16/BF16). Para o Ollama, você precisa de GGUF. Duas opções: baixar um GGUF já convertido pela comunidade ou fazer a conversão por conta própria.
#2. GGUF e conversão, se necessário
Se nenhum GGUF oficial ou da comunidade for adequado (variante exótica, quantização específica), a conversão passa pelo llama.cpp. O procedimento padrão:
#3. Instalar GLM-5 no Ollama (local)
Com o GGUF em mãos, o Ollama o importa por meio de um Modelfile. Crie um arquivo chamado Modelfile na mesma pasta do GGUF:
Em seguida, crie o modelo no Ollama, verifique se ele foi registrado e inicie-o:
#4. Testar a qualidade em francês
O francês do GLM-5 é um de seus pontos fortes para um modelo treinado principalmente com textos em chinês e inglês. Três prompts úteis para avaliar rapidamente:
- 01Raciocínio estruturado« Uma garrafa e sua tampa custam 1,10 €. A garrafa custa 1 € a mais que a tampa. Quanto custa a tampa? Detalhe seu raciocínio. » O GLM-5 9B deve responder 0,05 €, mostrando a equação.
- 02Síntese longaCole um artigo de 2.000 palavras e peça um resumo em 5 pontos-chave em francês. O modelo de 32B mantém uma linha de raciocínio clara, enquanto o de 9B encurta demais a resposta quando o contexto é longo.
- 03Código Python contextual« Escreva uma função Python que analise um CSV com delimitador ;, trate as aspas e retorne um gerador de dict. Sem pandas. » O GLM-5 produz código limpo e idiomático, enquanto o Qwen3-9B tende a importar csv sem tratar as aspas corretamente.
#5. Tokens/s medidos em RTX 4070 e 4090
Medições feitas com Ollama 0.6.x, OLLAMA_FLASH_ATTENTION=1, contexto 8k, prompt de 500 tokens, geração de 300 tokens. Média de 5 execuções.
- RTX 4070 12 GB — GLM-5 9B Q4_K_M
- ≈ 55-60 tokens/sec. Confortável para chat, o modelo permanece 100% na VRAM.
- RTX 4070 12 GB — GLM-5 9B Q5_K_M
- ≈ 48-52 tokens/s. Leve ganho de qualidade, perda de velocidade medida.
- RTX 4090 24 GB — GLM-5 9B Q4_K_M
- ≈ 110-120 tokens/sec. Bem acima do necessário para o 9B.
- RTX 4090 24 GB — GLM-5 32B Q4_K_M
- ≈ 22–26 tokens/s. Caso de uso pretendido: qualidade de um modelo de 32B com uma taxa de geração adequada ao uso interativo.
- RTX 4090 24 GB — GLM-5 32B Q5_K_M
- ≈ 18-22 tokens/s. Pouca margem de VRAM se o contexto for > 16k.
- Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
- ≈ 12 a 15 tokens/s. Aceitável para tarefas sem streaming (síntese, análise).
#GLM-5 vs Qwen3-32B vs DeepSeek V3.2
Com o mesmo prompt, na mesma máquina, é isso que observamos na prática. É uma análise qualitativa, não um benchmark padronizado — use-a como uma bússola, não como uma verdade absoluta.
- Francês de uso geral
- Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2 (em modo rápido). Qwen3 continua com vantagem em fluidez, GLM-5 fica muito próximo, DeepSeek V3.2 alucina mais em francês.
- Raciocínio estruturado
- GLM-5 32B (modo de raciocínio) ≈ Qwen3-32B (raciocínio). O DeepSeek V3.2 fica à frente se você permitir que ele use seu raciocínio prolongado, mas com um custo em tokens de 3 a 5 vezes o original.
- Código Python
- Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B. Para uso dedicado à programação, continue com o Qwen3-Coder. O GLM-5 32B tem um desempenho razoável como modelo generalista.
- Velocidade com a mesma quantidade de VRAM (24 GB)
- GLM-5 32B Q4 ≈ Qwen3-32B Q4 (~25 tok/s). DeepSeek V3.2 não cabe em 24 GB: é um MoE de 685B, que fica de fora da comparação nessa faixa.
- Espaço ocupado em disco
- GLM-5 32B Q4 ≈ 19 GB. Qwen3-32B Q4 ≈ 20 GB. DeepSeek V3.2 ≈ 380 GB Q4 — inviável sem um cluster.
#Solução de problemas
- Saída sem sentido ou inteiramente em chinês
- Tokenizer convertido incorretamente ou template incorreto. Verifique a versão do llama.cpp usada para a conversão e se o Modelfile inclui corretamente as tags <|user|>, <|assistant|>, [gMASK]<sop>.
- Tokens de parada ignorados (resposta infinita)
- Adicione PARAMETER stop "<|endoftext|>" e PARAMETER stop "<|user|>" no Modelfile. Sem isso, o modelo pode continuar gerando turnos de diálogo fictícios.
- OOM em contexto longo no RTX 4090
- O cache KV explode acima de 32k. Ative OLLAMA_KV_CACHE_TYPE=q8_0 (economia de aproximadamente 40% da VRAM usada pelo cache) ou reduza num_ctx.
- Velocidade < 10 tok/s com um modelo 9B na 4070
- Parte do modelo foi transferida para a RAM do sistema. Verifique com ollama ps: a coluna PROCESSOR deve mostrar 100% GPU. Se aparecer CPU, reduza num_ctx ou mude para Q3_K_M.
- Modo de raciocínio detalhado demais
- O GLM-5 pode gerar longas cadeias de pensamento. Para interrompê-las, peça explicitamente "resposta direta sem raciocínio intermediário" no prompt de sistema.
#GLM-5.2 foi lançado: é preciso migrar?
Desde 13 de junho de 2026, a Zhipu disponibiliza o GLM-5.2: cerca de 753B de parâmetros em MoE, licença MIT, contexto de 1M, otimizado para agentes de programação de longa duração. Até o momento, este é o modelo «frontier» com melhor suporte para execução local — existem quantizações GGUF (unsloth) tanto para Ollama quanto para LM Studio. Conte com um Mac de 256 GB ou uma máquina com RTX 4090 usando quantização de 2 bits: se seu hardware já dava conta do GLM-5, os passos de instalação deste guia permanecem os mesmos, apenas a referência do modelo muda.
#Para se aprofundar
O GLM-5 merece um pouco de investimento para tirar o máximo dele. Três caminhos úteis:
- Escolher a quantização correta
- Q4_K_M é o ponto ideal padrão, mas o GLM-5 32B em Q5_K_M cabe em 24 GB com um contexto razoável e melhora significativamente o código.
- Personalizar via Modelfile
- System prompt, template de resposta, parâmetros de sampling: um Modelfile bem ajustado evita repetir as instruções a cada sessão.
- Comparar com o Qwen3 em condições reais
- O guia Qwen3-32B vs GLM-5 (em breve) propõe um protocolo de comparação com 30 prompts representativos (FR, código, raciocínio, síntese).
Hardware recomendado: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — alternativa de PC para LLMs locais quantizados; não é o Mac do tutorial. Todo o hardware de IA →
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.