Instalar o Ollama no Windows 11: guia completo (2026)
No Windows 11, o Ollama é instalado por meio de um instalador convencional baixado do site oficial, com detecção automática da GPU (suporte nativo a CUDA da NVIDIA). Um único comando no terminal (ollama run qwen3.5:4b) baixa e inicia um primeiro modelo em cerca de 5 minutos, sem configuração manual nem linha de comando complexa.
Você tem um PC com Windows e quer rodar um LLM localmente, sem passar por ChatGPT. Ollama é provavelmente a ferramenta mais simples para isso: um instalador clássico, um comando, um modelo. Em 3 minutos, você já tem o Qwen 3.5 rodando na sua máquina.
#Por que usar Ollama?
O Ollama cuida de tudo o que é trabalhoso para você: download dos modelos, quantização, carregamento em VRAM, detecção do GPU, API HTTP local. Por trás, está o llama.cpp. Mas você não precisará compilá-lo.
A ferramenta é gratuita, open source e funciona totalmente offline após o download do modelo. Nenhum dado é enviado para um servidor remoto.
#Pré-requisitos
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- Windows 10 ou 11
- 64 bits. Ollama não tem versão de 32 bits.
- No mínimo 8 GB de RAM
- 16 GB confortáveis para modelos de 8 a 9B em quantização Q4.
- 10 GB de espaço em disco
- Um modelo de 4 a 9 bilhões de parâmetros pesa aproximadamente 3 a 7 GB. Reserve espaço com folga se planeja testar vários.
- GPU NVIDIA (opcional)
- Drivers atualizados, RTX 20/30/40/50 ou GTX 16. O Ollama detecta o GPU sozinho.
#1. Download
Acesse o site oficial e baixe o instalador para Windows.
O instalador ocupa aproximadamente 700 MB. Isso é normal: ele inclui os binários pré-compilados llama.cpp com suporte ao CUDA.
#2. Instalação
- 01Inicie o OllamaSetup.exeDê um clique duplo no instalador baixado. O Windows Defender pode exibir um aviso do SmartScreen — clique em "Informações adicionais" e depois em "Executar mesmo assim".
- 02Instalação silenciosaNenhuma janela de configuração: o instalador se instala em %LOCALAPPDATA%\Programs\Ollama e inicia automaticamente o serviço em segundo plano.
- 03Verifique o ícone do sistemaUm pequeno ícone do Ollama aparece perto do relógio, no canto inferior direito. Ele indica que o daemon está rodando.
- 04Abra um terminalPowerShell, Windows Terminal ou cmd.exe — não importa. Digite o comando de verificação abaixo.
Você deve ver algo como ollama version is 0.5.x. Se o comando não for reconhecido, feche e reabra o terminal — o PATH acaba de ser modificado.
#3. Seu primeiro modelo
O Qwen 3.5 4B é uma boa escolha inicial: multilíngue (incluindo um francês muito bom), leve, muito rápido e de excelente qualidade para o seu tamanho. Sob licença Apache 2.0.
Na primeira vez, o Ollama baixa o modelo (cerca de 3,4 GB em Q4). Nas vezes seguintes, a inicialização é instantânea. Quando o prompt >>> aparecer, você pode conversar.
#4. Verificar se a GPU está sendo usada
Por padrão, o Ollama detecta seu GPU NVIDIA e carrega o modelo nele. Para confirmar, execute este comando enquanto uma conversa está em andamento:
Na coluna PROCESSOR, você deve ver 100% GPU. Se aparecer CPU ou um percentual parcial, é porque parte do modelo está sendo carregada na RAM do sistema.
Para monitorar o uso da GPU em tempo real, abra outra janela do PowerShell:
#5. Uma interface limpa com Open WebUI
O terminal é bom para testes. Para uso diário, o Open WebUI é como o ChatGPT — histórico, markdown, anexos, tudo está lá. O método mais simples é usar o Docker Desktop.
Abra em seguida http://localhost:3000 no seu navegador. Crie uma conta (é local, nada sai da sua máquina) e seus modelos Ollama aparecerão na lista.
#Solução de problemas
- "ollama : comando não encontrado"
- O PATH não foi recarregado. Feche e abra novamente todos os terminais. Como último recurso, reinicie a sessão do Windows.
- Download bloqueado em 0%
- Um firewall corporativo às vezes bloqueia o Ollama. Tente a partir de outra rede ou configure um proxy via a variável HTTPS_PROXY.
- O modelo está rodando, mas é lento
- Verifique a saída de ollama ps. Se indicar 100% CPU, sua GPU é pequena demais ou não foi detectada corretamente. Atualize seus drivers NVIDIA.
- Respostas cortadas após algumas linhas
- A janela de contexto padrão é de 2048 tokens. Aumente com /set parameter num_ctx 8192 na conversa.
#Para se aprofundar
Você tem o Ollama rodando. As próximas etapas lógicas:
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.