Iniciante 3 minOllama

Instalar o Ollama no Windows 11: guia completo (2026)

Resposta direta

No Windows 11, o Ollama é instalado por meio de um instalador convencional baixado do site oficial, com detecção automática da GPU (suporte nativo a CUDA da NVIDIA). Um único comando no terminal (ollama run qwen3.5:4b) baixa e inicia um primeiro modelo em cerca de 5 minutos, sem configuração manual nem linha de comando complexa.

Você tem um PC com Windows e quer rodar um LLM localmente, sem passar por ChatGPT. Ollama é provavelmente a ferramenta mais simples para isso: um instalador clássico, um comando, um modelo. Em 3 minutos, você já tem o Qwen 3.5 rodando na sua máquina.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows 11

#Por que usar Ollama?

O Ollama cuida de tudo o que é trabalhoso para você: download dos modelos, quantização, carregamento em VRAM, detecção do GPU, API HTTP local. Por trás, está o llama.cpp. Mas você não precisará compilá-lo.

A ferramenta é gratuita, open source e funciona totalmente offline após o download do modelo. Nenhum dado é enviado para um servidor remoto.

i
Em resumo
Ollama = um daemon local que roda em segundo plano + uma CLI para conversar com ele. Os modelos vivem em um diretório em seu disco. Isso é tudo.

#Pré-requisitos

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Windows 10 ou 11
64 bits. Ollama não tem versão de 32 bits.
No mínimo 8 GB de RAM
16 GB confortáveis para modelos de 8 a 9B em quantização Q4.
10 GB de espaço em disco
Um modelo de 4 a 9 bilhões de parâmetros pesa aproximadamente 3 a 7 GB. Reserve espaço com folga se planeja testar vários.
GPU NVIDIA (opcional)
Drivers atualizados, RTX 20/30/40/50 ou GTX 16. O Ollama detecta o GPU sozinho.
→
Sem GPU, também funciona
Um CPU moderno roda um modelo pequeno (2 a 4B, como Qwen 3.5 2B ou Granite 4.2 3B) a 5–10 tokens por segundo. É lento, mas utilizável para testes. Para uso diário, busque uma GPU com pelo menos 6 GB de VRAM.

#1. Download

Acesse o site oficial e baixe o instalador para Windows.

Link oficial
https://ollama.com/download/windows

O instalador ocupa aproximadamente 700 MB. Isso é normal: ele inclui os binários pré-compilados llama.cpp com suporte ao CUDA.

!
Verifique o domínio
Baixe o Ollama somente de ollama.com. Versões redistribuídas no GitHub por terceiros podem estar infectadas com malware. A ferramenta é open source — se você é paranoico, compile a partir do repositório oficial.

#2. Instalação

  1. 01
    Inicie o OllamaSetup.exe
    Dê um clique duplo no instalador baixado. O Windows Defender pode exibir um aviso do SmartScreen — clique em "Informações adicionais" e depois em "Executar mesmo assim".
  2. 02
    Instalação silenciosa
    Nenhuma janela de configuração: o instalador se instala em %LOCALAPPDATA%\Programs\Ollama e inicia automaticamente o serviço em segundo plano.
  3. 03
    Verifique o ícone do sistema
    Um pequeno ícone do Ollama aparece perto do relógio, no canto inferior direito. Ele indica que o daemon está rodando.
  4. 04
    Abra um terminal
    PowerShell, Windows Terminal ou cmd.exe — não importa. Digite o comando de verificação abaixo.
PowerShell
ollama --version

Você deve ver algo como ollama version is 0.5.x. Se o comando não for reconhecido, feche e reabra o terminal — o PATH acaba de ser modificado.

#3. Seu primeiro modelo

O Qwen 3.5 4B é uma boa escolha inicial: multilíngue (incluindo um francês muito bom), leve, muito rápido e de excelente qualidade para o seu tamanho. Sob licença Apache 2.0.

Baixar e executar
ollama run qwen3.5:4b

Na primeira vez, o Ollama baixa o modelo (cerca de 3,4 GB em Q4). Nas vezes seguintes, a inicialização é instantânea. Quando o prompt >>> aparecer, você pode conversar.

Teste de conversa
>>> Bonjour, présente-toi en 2 phrases.

Je suis Qwen 3.5, un modèle de langage open-source développé par l'équipe Qwen (Alibaba).
Je fonctionne entièrement en local sur votre machine, sans connexion internet.
→
Sair da conversa
Digite /bye ou Ctrl+D para sair. O modelo permanece carregado na memória por alguns minutos, o que permite reinícios instantâneos.

#4. Verificar se a GPU está sendo usada

Por padrão, o Ollama detecta seu GPU NVIDIA e carrega o modelo nele. Para confirmar, execute este comando enquanto uma conversa está em andamento:

Status do modelo carregado
ollama ps

Na coluna PROCESSOR, você deve ver 100% GPU. Se aparecer CPU ou um percentual parcial, é porque parte do modelo está sendo carregada na RAM do sistema.

i
VRAM insuficiente?
O modelo Qwen 3.5 4B Q4 precisa de aproximadamente 3,4 GB de VRAM. Se sua GPU estiver realmente no limite de VRAM, passe para um modelo ainda mais leve: Granite 4.2 3B (ollama run granite4.2:3b, 2,2 GB) ou Qwen 3.5 2B (ollama run qwen3.5:2b, 1,9 GB).

Para monitorar o uso da GPU em tempo real, abra outra janela do PowerShell:

Monitoring
nvidia-smi -l 1

#5. Uma interface limpa com Open WebUI

O terminal é bom para testes. Para uso diário, o Open WebUI é como o ChatGPT — histórico, markdown, anexos, tudo está lá. O método mais simples é usar o Docker Desktop.

Iniciar o Open WebUI
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Abra em seguida http://localhost:3000 no seu navegador. Crie uma conta (é local, nada sai da sua máquina) e seus modelos Ollama aparecerão na lista.

#Solução de problemas

"ollama : comando não encontrado"
O PATH não foi recarregado. Feche e abra novamente todos os terminais. Como último recurso, reinicie a sessão do Windows.
Download bloqueado em 0%
Um firewall corporativo às vezes bloqueia o Ollama. Tente a partir de outra rede ou configure um proxy via a variável HTTPS_PROXY.
O modelo está rodando, mas é lento
Verifique a saída de ollama ps. Se indicar 100% CPU, sua GPU é pequena demais ou não foi detectada corretamente. Atualize seus drivers NVIDIA.
Respostas cortadas após algumas linhas
A janela de contexto padrão é de 2048 tokens. Aumente com /set parameter num_ctx 8192 na conversa.

#Para se aprofundar

Você tem o Ollama rodando. As próximas etapas lógicas:

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.