Intermediário 11 minOllama

GLM-5 localmente com Ollama: o concorrente open-weights

GLM-5 é a nova família de pesos abertos da Zhipu AI (Universidade de Tsinghua). Versões 9B e 32B, licença permissiva, raciocínio sólido, francês correto e desempenho respeitável em código. Este guia mostra como instalar o GLM-5 localmente com Ollama, mede o desempenho real nas RTX 4070 e 4090 e o compara com Qwen3-32B e DeepSeek V3.2 nas mesmas tarefas.

Por Mohamed Meguedmi·Atualização 2026-08-11·Testado no Windows, macOS e Linux

#Por que o GLM-5?

O GLM-5 não tem a fama de Qwen3 ou DeepSeek, mas é um dos modelos chineses com pesos abertos mais completos lançados nos últimos meses. A versão 9B é voltada para configurações modestas (12 GB de VRAM são suficientes), enquanto a versão 32B é destinada à RTX 4090 e ao Mac Studio. No papel, ele alega pontuações próximas às do GPT-4o-mini em MMLU e HumanEval, com o mesmo tamanho que o Qwen3-32B.

Na prática, GLM-5 se destaca em três aspectos: o raciocínio estruturado (modo thinking semelhante ao do Qwen3), o francês (sensivelmente melhor que o Qwen3-9B em prompts complexos) e o código Python. Os pontos em que decepciona: a janela de contexto fica limitada a 128k em execução local, apesar da promessa de 1M, e a visão não está integrada (diferentemente do GLM-4V).

i
GLM-5 vs GLM 5.1
Este guia aborda o GLM-5 (versão inicial). O GLM 5.1 (versão posterior) corrige várias regressões em programação e melhora a capacidade de seguir instruções. Se você está começando do zero hoje, leia também o guia de GLM 5.1 do site antes de escolher.

#Pré-requisitos de hardware

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
GLM-5 9B Q4_K_M
≈ 5,5 GB de VRAM. RTX 3060 12 GB, RTX 4060 8 GB (offload parcial), Mac M2 com 16 GB de memória unificada, todas as RTX 4070+.
GLM-5 32B Q4_K_M
≈ 19 GB de VRAM. Uma RTX 4090 de 24 GB dá conta com folga, assim como uma RTX 3090 de 24 GB. Com 16 GB (4080), é preciso passar para Q3_K_M.
GLM-5 32B Q5_K_M
≈ 22-23 GB de VRAM. Cabe na RTX 4090, mas com pouca margem. Prefira Q4_K_M se ativar um contexto longo.
Ollama 0.6.0+
O suporte ao GLM-5 foi adicionado progressivamente. É necessária uma versão recente para o tokenizer e o template de chat.
Disco
Reserve de 6 GB (9B Q4) a 23 GB (32B Q5). Mais se você mantiver várias quantizações em paralelo.

#1. Baixar o modelo do Hugging Face

A Zhipu AI publica os pesos oficiais no Hugging Face sob a organização THUDM. Dois repositórios são relevantes para você:

Repositório oficial 9B
https://huggingface.co/THUDM/glm-5-9b-chat
Repositório oficial 32B
https://huggingface.co/THUDM/glm-5-32b-chat

Esses repositórios contêm os pesos no formato safetensors (FP16/BF16). Para o Ollama, você precisa de GGUF. Duas opções: baixar um GGUF já convertido pela comunidade ou fazer a conversão por conta própria.

→
Atalho: GGUF pronto
Procure no Hugging Face por glm-5 GGUF — bartowski, mradermacher e lmstudio-community publicam conversões Q4_K_M, Q5_K_M e Q8_0 atualizadas. É a opção pragmática para 95% dos casos.

#2. GGUF e conversão, se necessário

Se nenhum GGUF oficial ou da comunidade for adequado (variante exótica, quantização específica), a conversão passa pelo llama.cpp. O procedimento padrão:

Clonar o llama.cpp e instalar as dependências
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
pip install -r requirements.txt
Converter HF → GGUF FP16
python convert_hf_to_gguf.py /chemin/vers/glm-5-9b-chat \
  --outfile glm-5-9b-chat-f16.gguf \
  --outtype f16
Quantizar em Q4_K_M
./build/bin/llama-quantize \
  glm-5-9b-chat-f16.gguf \
  glm-5-9b-chat-Q4_K_M.gguf \
  Q4_K_M
!
Tokenizer GLM
O GLM utiliza um tokenizer derivado do SentencePiece. Se convert_hf_to_gguf.py reclamar da ausência de tokens especiais, atualize o llama.cpp (o suporte ao GLM-5 foi adicionado em uma PR recente). Com uma versão muito antiga, a conversão é concluída com sucesso, mas a inferência gera texto sem sentido.

#3. Instalar GLM-5 no Ollama (local)

Com o GGUF em mãos, o Ollama o importa por meio de um Modelfile. Crie um arquivo chamado Modelfile na mesma pasta do GGUF:

Modelfile para GLM-5 9B
FROM ./glm-5-9b-chat-Q4_K_M.gguf

PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER num_ctx 32768
PARAMETER stop "<|user|>"
PARAMETER stop "<|endoftext|>"

TEMPLATE """[gMASK]<sop>{{ if .System }}<|system|>
{{ .System }}{{ end }}<|user|>
{{ .Prompt }}<|assistant|>
{{ .Response }}"""

SYSTEM """Tu es un assistant utile, précis et concis. Tu réponds en français sauf demande contraire."""

Em seguida, crie o modelo no Ollama, verifique se ele foi registrado e inicie-o:

Criação e inicialização
ollama create glm5-9b -f Modelfile
ollama list
ollama run glm5-9b
→
Quando o suporte nativo chegar
Se o Ollama publicar o GLM-5 em seu registro oficial (ollama run glm5 sem Modelfile), prefira essa versão: o template de chat será mantido pelo projeto de origem e você evitará erros nos tokens de parada.

#4. Testar a qualidade em francês

O francês do GLM-5 é um de seus pontos fortes para um modelo treinado principalmente com textos em chinês e inglês. Três prompts úteis para avaliar rapidamente:

  1. 01
    Raciocínio estruturado
    « Uma garrafa e sua tampa custam 1,10 €. A garrafa custa 1 € a mais que a tampa. Quanto custa a tampa? Detalhe seu raciocínio. » O GLM-5 9B deve responder 0,05 €, mostrando a equação.
  2. 02
    Síntese longa
    Cole um artigo de 2.000 palavras e peça um resumo em 5 pontos-chave em francês. O modelo de 32B mantém uma linha de raciocínio clara, enquanto o de 9B encurta demais a resposta quando o contexto é longo.
  3. 03
    Código Python contextual
    « Escreva uma função Python que analise um CSV com delimitador ;, trate as aspas e retorne um gerador de dict. Sem pandas. » O GLM-5 produz código limpo e idiomático, enquanto o Qwen3-9B tende a importar csv sem tratar as aspas corretamente.
i
Modo thinking
O GLM-5 possui um modo de cadeia de pensamento que pode ser ativado por um prefixo de sistema (consulte o card do modelo no HF para saber o formato exato). Quando esse modo é ativado, a qualidade do raciocínio melhora — ao custo de aproximadamente 30 a 40% mais tokens.

#5. Tokens/s medidos em RTX 4070 e 4090

Medições feitas com Ollama 0.6.x, OLLAMA_FLASH_ATTENTION=1, contexto 8k, prompt de 500 tokens, geração de 300 tokens. Média de 5 execuções.

RTX 4070 12 GB — GLM-5 9B Q4_K_M
≈ 55-60 tokens/sec. Confortável para chat, o modelo permanece 100% na VRAM.
RTX 4070 12 GB — GLM-5 9B Q5_K_M
≈ 48-52 tokens/s. Leve ganho de qualidade, perda de velocidade medida.
RTX 4090 24 GB — GLM-5 9B Q4_K_M
≈ 110-120 tokens/sec. Bem acima do necessário para o 9B.
RTX 4090 24 GB — GLM-5 32B Q4_K_M
≈ 22–26 tokens/s. Caso de uso pretendido: qualidade de um modelo de 32B com uma taxa de geração adequada ao uso interativo.
RTX 4090 24 GB — GLM-5 32B Q5_K_M
≈ 18-22 tokens/s. Pouca margem de VRAM se o contexto for > 16k.
Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
≈ 12 a 15 tokens/s. Aceitável para tarefas sem streaming (síntese, análise).
→
Ative o Flash Attention
Definir OLLAMA_FLASH_ATTENTION=1 no ambiente traz um ganho de 10–15% no GLM-5 32B e estabiliza a VRAM em contextos longos. Em combinação com OLLAMA_KV_CACHE_TYPE=q8_0, você libera 2–3 GB adicionais sem degradação visível.

#GLM-5 vs Qwen3-32B vs DeepSeek V3.2

Com o mesmo prompt, na mesma máquina, é isso que observamos na prática. É uma análise qualitativa, não um benchmark padronizado — use-a como uma bússola, não como uma verdade absoluta.

Francês de uso geral
Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2 (em modo rápido). Qwen3 continua com vantagem em fluidez, GLM-5 fica muito próximo, DeepSeek V3.2 alucina mais em francês.
Raciocínio estruturado
GLM-5 32B (modo de raciocínio) ≈ Qwen3-32B (raciocínio). O DeepSeek V3.2 fica à frente se você permitir que ele use seu raciocínio prolongado, mas com um custo em tokens de 3 a 5 vezes o original.
Código Python
Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B. Para uso dedicado à programação, continue com o Qwen3-Coder. O GLM-5 32B tem um desempenho razoável como modelo generalista.
Velocidade com a mesma quantidade de VRAM (24 GB)
GLM-5 32B Q4 ≈ Qwen3-32B Q4 (~25 tok/s). DeepSeek V3.2 não cabe em 24 GB: é um MoE de 685B, que fica de fora da comparação nessa faixa.
Espaço ocupado em disco
GLM-5 32B Q4 ≈ 19 GB. Qwen3-32B Q4 ≈ 20 GB. DeepSeek V3.2 ≈ 380 GB Q4 — inviável sem um cluster.
i
Veredito prático
Se você tiver 24 GB de VRAM e quiser um modelo 32B de uso geral, a escolha fica entre GLM-5 e Qwen3. O GLM-5 é mais interessante para o raciocínio estruturado e para explorar opções menos convencionais, enquanto o Qwen3-32B continua sendo uma aposta confiável. O DeepSeek V3.2 continua sendo um modelo para API ou servidores de grande porte — com 24 GB, ele nem entra na disputa.

#Solução de problemas

Saída sem sentido ou inteiramente em chinês
Tokenizer convertido incorretamente ou template incorreto. Verifique a versão do llama.cpp usada para a conversão e se o Modelfile inclui corretamente as tags <|user|>, <|assistant|>, [gMASK]<sop>.
Tokens de parada ignorados (resposta infinita)
Adicione PARAMETER stop "<|endoftext|>" e PARAMETER stop "<|user|>" no Modelfile. Sem isso, o modelo pode continuar gerando turnos de diálogo fictícios.
OOM em contexto longo no RTX 4090
O cache KV explode acima de 32k. Ative OLLAMA_KV_CACHE_TYPE=q8_0 (economia de aproximadamente 40% da VRAM usada pelo cache) ou reduza num_ctx.
Velocidade < 10 tok/s com um modelo 9B na 4070
Parte do modelo foi transferida para a RAM do sistema. Verifique com ollama ps: a coluna PROCESSOR deve mostrar 100% GPU. Se aparecer CPU, reduza num_ctx ou mude para Q3_K_M.
Modo de raciocínio detalhado demais
O GLM-5 pode gerar longas cadeias de pensamento. Para interrompê-las, peça explicitamente "resposta direta sem raciocínio intermediário" no prompt de sistema.

#GLM-5.2 foi lançado: é preciso migrar?

Desde 13 de junho de 2026, a Zhipu disponibiliza o GLM-5.2: cerca de 753B de parâmetros em MoE, licença MIT, contexto de 1M, otimizado para agentes de programação de longa duração. Até o momento, este é o modelo «frontier» com melhor suporte para execução local — existem quantizações GGUF (unsloth) tanto para Ollama quanto para LM Studio. Conte com um Mac de 256 GB ou uma máquina com RTX 4090 usando quantização de 2 bits: se seu hardware já dava conta do GLM-5, os passos de instalação deste guia permanecem os mesmos, apenas a referência do modelo muda.

i
Guia dedicado em breve
Um guia completo sobre GLM-5.2 (instalação do Ollama + LM Studio, configurações realistas, expectativas honestas sobre as velocidades) está em preparação e será publicado esta semana no site.

#Para se aprofundar

O GLM-5 merece um pouco de investimento para tirar o máximo dele. Três caminhos úteis:

Escolher a quantização correta
Q4_K_M é o ponto ideal padrão, mas o GLM-5 32B em Q5_K_M cabe em 24 GB com um contexto razoável e melhora significativamente o código.
Personalizar via Modelfile
System prompt, template de resposta, parâmetros de sampling: um Modelfile bem ajustado evita repetir as instruções a cada sessão.
Comparar com o Qwen3 em condições reais
O guia Qwen3-32B vs GLM-5 (em breve) propõe um protocolo de comparação com 30 prompts representativos (FR, código, raciocínio, síntese).

Hardware recomendado: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — alternativa de PC para LLMs locais quantizados; não é o Mac do tutorial. Todo o hardware de IA →

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.