Intermediário 10 minWindows

Ollama em WSL2 ou no Windows nativo: qual escolher ?

No Windows, coexistem duas formas de executar o Ollama: o instalador nativo .exe e uma instalação Linux dentro do WSL2. A escolha entre Ollama no WSL2 e Ollama nativo não é apenas uma questão de gosto — ela afeta o desempenho da GPU, o acesso aos arquivos e o suporte à AMD. Este guia indica qual escolher com base em números e casos de uso concretos, para que você escolha a configuração certa logo na primeira tentativa.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows 11

#O desafio: dois Ollama em uma mesma máquina

Desde que o Ollama passou a oferecer um instalador nativo para Windows, a pergunta “Ollama WSL2 ou nativo?” não para de aparecer. As duas abordagens executam exatamente o mesmo daemon, escutam por padrão em http://localhost:11434 e servem os mesmos modelos GGUF. A diferença está em outros aspectos: na forma como a GPU é exposta, no local onde ficam seus arquivos e no ecossistema de ferramentas que você usa em torno dela.

Resumindo, o Windows nativo ganha em simplicidade de instalação e integração no desktop, enquanto o WSL2 ganha em coerência com um fluxo de trabalho Linux/dev e em compatibilidade com ferramentas que existem apenas no lado Unix. Nenhum dos dois é absolutamente melhor — a escolha certa depende do que você faz com seus LLM.

Ollama nativo para Windows
Um .exe, um ícone na bandeja do sistema, o daemon inicia com o Windows. Nenhuma camada Linux para gerenciar.
Ollama no WSL2
Uma distribuição Linux (normalmente Ubuntu) em que você instala Ollama como em um servidor. Ideal se sua stack já é Linux.
Ponto em comum
Mesma API na porta 11434, mesmos modelos, mesmos comandos. Além disso, é possível fazer um cliente Windows se comunicar com um servidor WSL2 e vice-versa.
i
Não execute os dois ao mesmo tempo
Uma instância nativa do Ollama e uma instância do Ollama no WSL2 tentam usar a mesma porta 11434. Se as duas estiverem em execução, você terá conflitos confusos ("address already in use" ou requisições direcionadas ao daemon errado). Escolha uma delas ou altere a porta da outra via OLLAMA_HOST.

#Pré-requisitos

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Para comparar de forma honesta os dois, é necessário que a placa de vídeo seja corretamente suportada em cada ambiente. É aí que a maioria das decepções surge.

Windows 11 (ou 10 recente)
WSL2 com aceleração por GPU (WSLg) exige Windows 11 ou uma build recente e atualizada do Windows 10.
Driver da GPU atualizado no Windows
Sob WSL2, é o driver do Windows que expõe o GPU ao Linux via /dev/dxg. Instale o driver NVIDIA (Game Ready ou Studio) ou AMD Adrenalin mais recente, NÃO um driver Linux na distribuição.
WSL2 ativado
O comando « wsl --install », executado em uma sessão do PowerShell com privilégios de administrador, instala o WSL2 e uma distribuição Ubuntu por padrão.
VRAM suficiente
Os valores de referência em Q4_K_M permanecem iguais nos dois cenários: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB. O WSL2 não altera esses requisitos.
!
Erro comum: o driver Linux que quebra tudo
Em WSL2, nunca instale um driver GPU Linux (o .run NVIDIA, ou os pacotes mesa/amdgpu). A GPU já está exposta pelo driver Windows. Instalar um driver Linux por cima quebra a aceleração. Instala-se apenas o toolkit CUDA ou os runtimes ROCm no espaço de usuário, não o driver do kernel.

#Instalar corretamente Ollama no WSL2

A instalação no WSL2 é idêntica à de um servidor Linux: o script oficial detecta a GPU exposta pelo WSLg e configura a aceleração automaticamente.

  1. 01
    Ativar WSL2
    Em uma janela do PowerShell aberta como administrador: « wsl --install ». Reinicie, se solicitado. Em seguida, verifique com « wsl -l -v » se sua distribuição está realmente em VERSION 2.
  2. 02
    Atualizar a distribuição
    Abra o Ubuntu e execute 'sudo apt update && sudo apt upgrade -y'. Uma distribuição atualizada evita surpresas com os runtimes de GPU.
  3. 03
    Instalar Ollama
    Inicie o script oficial: « curl -fsSL https://ollama.com/install.sh | sh ». Ele detecta NVIDIA (via CUDA exposto por WSLg) ou AMD (ROCm) e anuncia isso nos logs.
  4. 04
    Verificar a GPU
    Carregue um modelo pequeno e veja « ollama ps »: a coluna PROCESSOR deve indicar GPU, não CPU. Se for CPU, a aceleração não está ativa.
  5. 05
    Testar um modelo
    « ollama run qwen3.5:9b » e então faça uma pergunta. Esse modelo de 2026 (6,6 GB em Q4, 256k de contexto, visão) é a escolha padrão em uma placa de 8 GB. Adicione --verbose para ver os tokens/segundo reais.
WSL2 (Ubuntu) — instalação
# Dans le terminal Ubuntu de WSL2
sudo apt update && sudo apt upgrade -y

# Installation officielle d'Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Vérifier la prise en charge du GPU
ollama pull qwen3.5:9b
ollama run qwen3.5:9b --verbose

# Le processeur utilisé (GPU attendu)
ollama ps
→
Verificar se a GPU é reconhecida corretamente pelo WSL2
Para NVIDIA, « nvidia-smi » deve funcionar diretamente no WSL2 sem que você tenha instalado nada no Linux — isso indica que o WSLg está disponibilizando a placa corretamente. Se o comando responder, o Ollama saberá usá-la.

#Desempenho da GPU: nativo vs WSL2, com números para embasar a comparação

Essa é A pergunta que motiva este guia. Boa notícia: para a inferência de LLM em uma GPU NVIDIA, a diferença entre o Ollama nativo e o WSL2 é pequena. Uma vez carregado o modelo na VRAM, o cálculo é feito na GPU nos dois casos, e o WSL2 praticamente não acrescenta sobrecarga à geração de tokens em si.

Na prática, em uma mesma placa (por exemplo, uma RTX 4070 de 12 GB com um modelo de 8B em Q4_K_M), observam-se taxas de geração muito próximas — a diferença geralmente fica dentro de uma margem de alguns por cento, muitas vezes encoberta pela variabilidade das medições. O WSL2 pode causar uma pequena perda de desempenho no carregamento inicial do modelo a partir do disco: o sistema de arquivos do WSL2 é rápido no seu disco virtual ext4, mas o acesso aos arquivos armazenados no Windows (via /mnt/c) é consideravelmente mais lento.

Geração de tokens (GPU)
Praticamente igual entre a execução nativa e o WSL2 com GPUs NVIDIA. A GPU faz o trabalho nos dois casos; a camada WSL2 é transparente para o cálculo.
Carregamento do modelo
Rápido se os modelos estiverem no sistema de arquivos Linux nativo do WSL2. Lento se o Ollama ler seus blobs a partir de /mnt/c/... (passagem pela ponte com o Windows).
Latência do primeiro token
Comparável, desde que o modelo já esteja no cache de VRAM. O primeiro carregamento a frio é a etapa crítica.
Custo adicional de CPU
Negligível para a inferência. WSL2 é uma verdadeira VM leve, não uma emulação; o custo de virtualização não se percebe sob cargas de GPU.
→
Mantenha seus modelos no ambiente Linux
No WSL2, deixe o Ollama armazenar seus modelos no local padrão (~/.ollama no sistema de arquivos ext4 da distribuição). Não aponte OLLAMA_MODELS para um caminho /mnt/c/...: você perderia muito em velocidade de carregamento devido à passagem pela ponte entre os sistemas de arquivos.

Conclusão sobre desempenho puro: se você tiver uma placa NVIDIA, a velocidade de geração NÃO é o critério que determina a escolha entre execução nativa e WSL2. Escolha conforme seu fluxo de trabalho. O desempenho só volta a ser um argumento em dois casos: o armazenamento dos modelos (que devem ficar no lado Linux sob WSL2) e o suporte à AMD, que abordamos agora.

#O caso da AMD: ROCm sob WSL2

Com GPUs AMD, a história é diferente e tem mais nuances. O Ollama utiliza ROCm para acelerar a execução nas Radeon compatíveis. Porém, o ROCm foi por muito tempo um terreno minado no Windows, e o WSL2 mudou a situação — nem sempre para melhor, dependendo da sua placa.

AMD no Windows nativo
O Ollama inclui uma biblioteca ROCm para Windows. Nas placas oficialmente suportadas (RX 7000 recentes, algumas RX 6000), a aceleração funciona sem WSL2. Muitas vezes, esse é o caminho mais simples para um desktop AMD.
AMD no WSL2
O ROCm está disponível para WSL2, mas a lista de GPUs suportadas é mais restrita e o setup é mais delicado. Pode ser necessário se você quiser ferramentas Linux, mas não é mais rápido por si só.
Placas não suportadas
Muitas placas Radeon mais antigas ou APUs não estão na lista oficial do ROCm. Nessas placas, o Ollama pode recorrer à CPU nos dois ambientes.
Solução alternativa com HSA
A variável HSA_OVERRIDE_GFX_VERSION permite, em alguns casos, forçar o reconhecimento de uma GPU semelhante a um modelo compatível. Uso reservado a usuários experientes, sem garantia.
!
AMD: verifique a compatibilidade ANTES de escolher
Não parta do pressuposto de que sua Radeon terá aceleração no WSL2. Consulte a lista de GPUs compatíveis com ROCm na documentação oficial da AMD e do Ollama. Para uma placa AMD recente voltada ao consumidor, o instalador nativo do Ollama para Windows geralmente é a opção menos problemática.
WSL2 — diagnóstico AMD ROCm
# La carte AMD est-elle vue par ROCm dans WSL2 ?
rocminfo | grep -i 'Name\|gfx'

# Forcer une version gfx proche (avancé, sans garantie)
# Exemple pour cibler gfx1030 sur une carte non listée :
HSA_OVERRIDE_GFX_VERSION=10.3.0 ollama serve

#Acesso a arquivos e integração com VS Code

Além do desempenho, muitas vezes é o acesso aos arquivos que determina a escolha. Os dois sistemas de arquivos (NTFS do Windows e ext4 do Linux no WSL2) podem ser acessados a partir do outro sistema, mas atravessar essa ponte tem um custo de desempenho, e as convenções de caminhos são diferentes.

Do WSL2 para o Windows
Seus discos Windows estão montados sob /mnt/c, /mnt/d, etc. Útil para ler uma pasta de documentos, mas lento para acessos intensivos (carregamento de grandes modelos, indexação RAG).
De Windows para WSL2
O sistema de arquivos Linux pode ser acessado pelo caminho de rede \\wsl$\Ubuntu\ no Explorador de Arquivos. É útil para colocar um arquivo ali, mas evite executar ferramentas do Windows de forma intensiva nesse local.
Regra de ouro
Mantenha cada carga de trabalho no seu sistema de arquivos nativo. Projeto de desenvolvimento Linux → no WSL2. Documentos de escritório → no Windows. Assim, você evita a ponte lenta.

No VS Code, a integração com WSL é excelente e favorece fortemente o WSL2 para uso de desenvolvimento. A extensão oficial "WSL" abre um projeto diretamente na distribuição: o servidor do VS Code roda no Linux, o terminal integrado é um shell Linux e seu código de chamada à API Ollama é executado no mesmo ambiente que o daemon.

Chamada à API Ollama (idêntica no Windows nativo e no WSL2)
import requests

# Même endpoint quel que soit l'environnement
resp = requests.post(
    "http://localhost:11434/api/generate",
    json={
        "model": "qwen3.5:9b",
        "prompt": "Explique WSL2 en une phrase.",
        "stream": False,
    },
    timeout=120,
)
print(resp.json()["response"])
→
Cliente Windows, servidor WSL2 (ou o inverso)
Graças ao redirecionamento de localhost do WSL2, um programa executado no Windows pode chamar uma instância do Ollama que roda no WSL2 em http://localhost:11434, e vice-versa. Você não precisa colocar tudo do mesmo lado — útil para um IDE no Windows controlado por um daemon Linux.

#Qual é a configuração recomendada para o seu uso

Aqui está a síntese prática. Escolha com base no seu perfil predominante, em vez de microdiferenças de tokens por segundo.

Uso em desktop / público geral (NVIDIA)
Ollama nativo para Windows. Instalação em um clique, inicialização ao entrar na sessão, nenhuma camada Linux para manter. Perfeito com LM Studio ou Open WebUI como interface.
Desenvolvedor Linux / stack Unix
Ollama no WSL2. Você tem suas ferramentas (scripts bash, Docker, Python venv) no mesmo ambiente do daemon, com uma integração exemplar com o VS Code.
GPU AMD para o público em geral
Teste primeiro a versão nativa para Windows: geralmente é a mais simples de colocar em funcionamento com a ROCm integrada. Passe para WSL2 apenas se seu fluxo de trabalho exigir isso e sua placa tiver suporte.
Servidor / compartilhamento pela rede
O WSL2 se aproxima de uma implantação convencional em servidor Linux e facilita a reprodutibilidade (os mesmos comandos usados em produção). Lembre-se de OLLAMA_HOST para expô-lo.
i
Em poucas palavras
GPU NVIDIA + uso em desktop → nativo. Fluxo de trabalho de desenvolvimento em Linux → WSL2. O desempenho de geração é quase idêntico; a escolha deve ser determinada pelo ecossistema ao redor.

#Solução de problemas

« ollama ps » exibe CPU em vez de GPU
Sob WSL2, verifique se « nvidia-smi » responde. Se não, atualize o driver do lado do Windows e não instale nenhum driver Linux na distribuição.
Carregamento do modelo muito lento
Seus modelos estão provavelmente armazenados em /mnt/c. Mova-os para o sistema de arquivos Linux (~/.ollama) para recuperar a velocidade.
« address already in use » na porta 11434
Um Ollama nativo e um Ollama WSL2 rodam ao mesmo tempo. Pare um deles ou mude a porta do outro com OLLAMA_HOST=127.0.0.1:11435.
GPU AMD ignorada
Placa fora da lista do ROCm. Verifique a compatibilidade, tente HSA_OVERRIDE_GFX_VERSION se for o caso ou recorra à execução nativa no Windows.
O cliente Windows não consegue se conectar ao daemon WSL2
Use http://localhost:11434 (o redirecionamento do WSL2 faz a ponte) e certifique-se de que apenas um daemon esteja escutando nessa porta.
WSL2 — alterar a porta para evitar um conflito
# Faire écouter l'Ollama WSL2 sur un autre port
OLLAMA_HOST=127.0.0.1:11435 ollama serve

# Puis interroger ce daemon précisément
curl http://localhost:11435/api/tags

#Para se aprofundar

Após escolher seu ambiente, esses guias irão ajudá-lo a tirar o máximo dele:

Instalar o Ollama no Windows 11
Passo a passo do instalador nativo, complementar a este comparativo se você optar pela via Windows.
Solução de problemas do Ollama: GPU não detectada, lentidão, erros de memória
Para saber mais sobre falhas de GPU, tanto na execução nativa quanto no WSL2.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para ajustar o uso de VRAM de acordo com sua placa, independentemente do ambiente.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.