Ollama em WSL2 ou no Windows nativo: qual escolher ?
No Windows, coexistem duas formas de executar o Ollama: o instalador nativo .exe e uma instalação Linux dentro do WSL2. A escolha entre Ollama no WSL2 e Ollama nativo não é apenas uma questão de gosto — ela afeta o desempenho da GPU, o acesso aos arquivos e o suporte à AMD. Este guia indica qual escolher com base em números e casos de uso concretos, para que você escolha a configuração certa logo na primeira tentativa.
#O desafio: dois Ollama em uma mesma máquina
Desde que o Ollama passou a oferecer um instalador nativo para Windows, a pergunta “Ollama WSL2 ou nativo?” não para de aparecer. As duas abordagens executam exatamente o mesmo daemon, escutam por padrão em http://localhost:11434 e servem os mesmos modelos GGUF. A diferença está em outros aspectos: na forma como a GPU é exposta, no local onde ficam seus arquivos e no ecossistema de ferramentas que você usa em torno dela.
Resumindo, o Windows nativo ganha em simplicidade de instalação e integração no desktop, enquanto o WSL2 ganha em coerência com um fluxo de trabalho Linux/dev e em compatibilidade com ferramentas que existem apenas no lado Unix. Nenhum dos dois é absolutamente melhor — a escolha certa depende do que você faz com seus LLM.
- Ollama nativo para Windows
- Um .exe, um ícone na bandeja do sistema, o daemon inicia com o Windows. Nenhuma camada Linux para gerenciar.
- Ollama no WSL2
- Uma distribuição Linux (normalmente Ubuntu) em que você instala Ollama como em um servidor. Ideal se sua stack já é Linux.
- Ponto em comum
- Mesma API na porta 11434, mesmos modelos, mesmos comandos. Além disso, é possível fazer um cliente Windows se comunicar com um servidor WSL2 e vice-versa.
#Pré-requisitos
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Para comparar de forma honesta os dois, é necessário que a placa de vídeo seja corretamente suportada em cada ambiente. É aí que a maioria das decepções surge.
- Windows 11 (ou 10 recente)
- WSL2 com aceleração por GPU (WSLg) exige Windows 11 ou uma build recente e atualizada do Windows 10.
- Driver da GPU atualizado no Windows
- Sob WSL2, é o driver do Windows que expõe o GPU ao Linux via /dev/dxg. Instale o driver NVIDIA (Game Ready ou Studio) ou AMD Adrenalin mais recente, NÃO um driver Linux na distribuição.
- WSL2 ativado
- O comando « wsl --install », executado em uma sessão do PowerShell com privilégios de administrador, instala o WSL2 e uma distribuição Ubuntu por padrão.
- VRAM suficiente
- Os valores de referência em Q4_K_M permanecem iguais nos dois cenários: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB. O WSL2 não altera esses requisitos.
#Instalar corretamente Ollama no WSL2
A instalação no WSL2 é idêntica à de um servidor Linux: o script oficial detecta a GPU exposta pelo WSLg e configura a aceleração automaticamente.
- 01Ativar WSL2Em uma janela do PowerShell aberta como administrador: « wsl --install ». Reinicie, se solicitado. Em seguida, verifique com « wsl -l -v » se sua distribuição está realmente em VERSION 2.
- 02Atualizar a distribuiçãoAbra o Ubuntu e execute 'sudo apt update && sudo apt upgrade -y'. Uma distribuição atualizada evita surpresas com os runtimes de GPU.
- 03Instalar OllamaInicie o script oficial: « curl -fsSL https://ollama.com/install.sh | sh ». Ele detecta NVIDIA (via CUDA exposto por WSLg) ou AMD (ROCm) e anuncia isso nos logs.
- 04Verificar a GPUCarregue um modelo pequeno e veja « ollama ps »: a coluna PROCESSOR deve indicar GPU, não CPU. Se for CPU, a aceleração não está ativa.
- 05Testar um modelo« ollama run qwen3.5:9b » e então faça uma pergunta. Esse modelo de 2026 (6,6 GB em Q4, 256k de contexto, visão) é a escolha padrão em uma placa de 8 GB. Adicione --verbose para ver os tokens/segundo reais.
#Desempenho da GPU: nativo vs WSL2, com números para embasar a comparação
Essa é A pergunta que motiva este guia. Boa notícia: para a inferência de LLM em uma GPU NVIDIA, a diferença entre o Ollama nativo e o WSL2 é pequena. Uma vez carregado o modelo na VRAM, o cálculo é feito na GPU nos dois casos, e o WSL2 praticamente não acrescenta sobrecarga à geração de tokens em si.
Na prática, em uma mesma placa (por exemplo, uma RTX 4070 de 12 GB com um modelo de 8B em Q4_K_M), observam-se taxas de geração muito próximas — a diferença geralmente fica dentro de uma margem de alguns por cento, muitas vezes encoberta pela variabilidade das medições. O WSL2 pode causar uma pequena perda de desempenho no carregamento inicial do modelo a partir do disco: o sistema de arquivos do WSL2 é rápido no seu disco virtual ext4, mas o acesso aos arquivos armazenados no Windows (via /mnt/c) é consideravelmente mais lento.
- Geração de tokens (GPU)
- Praticamente igual entre a execução nativa e o WSL2 com GPUs NVIDIA. A GPU faz o trabalho nos dois casos; a camada WSL2 é transparente para o cálculo.
- Carregamento do modelo
- Rápido se os modelos estiverem no sistema de arquivos Linux nativo do WSL2. Lento se o Ollama ler seus blobs a partir de /mnt/c/... (passagem pela ponte com o Windows).
- Latência do primeiro token
- Comparável, desde que o modelo já esteja no cache de VRAM. O primeiro carregamento a frio é a etapa crítica.
- Custo adicional de CPU
- Negligível para a inferência. WSL2 é uma verdadeira VM leve, não uma emulação; o custo de virtualização não se percebe sob cargas de GPU.
Conclusão sobre desempenho puro: se você tiver uma placa NVIDIA, a velocidade de geração NÃO é o critério que determina a escolha entre execução nativa e WSL2. Escolha conforme seu fluxo de trabalho. O desempenho só volta a ser um argumento em dois casos: o armazenamento dos modelos (que devem ficar no lado Linux sob WSL2) e o suporte à AMD, que abordamos agora.
#O caso da AMD: ROCm sob WSL2
Com GPUs AMD, a história é diferente e tem mais nuances. O Ollama utiliza ROCm para acelerar a execução nas Radeon compatíveis. Porém, o ROCm foi por muito tempo um terreno minado no Windows, e o WSL2 mudou a situação — nem sempre para melhor, dependendo da sua placa.
- AMD no Windows nativo
- O Ollama inclui uma biblioteca ROCm para Windows. Nas placas oficialmente suportadas (RX 7000 recentes, algumas RX 6000), a aceleração funciona sem WSL2. Muitas vezes, esse é o caminho mais simples para um desktop AMD.
- AMD no WSL2
- O ROCm está disponível para WSL2, mas a lista de GPUs suportadas é mais restrita e o setup é mais delicado. Pode ser necessário se você quiser ferramentas Linux, mas não é mais rápido por si só.
- Placas não suportadas
- Muitas placas Radeon mais antigas ou APUs não estão na lista oficial do ROCm. Nessas placas, o Ollama pode recorrer à CPU nos dois ambientes.
- Solução alternativa com HSA
- A variável HSA_OVERRIDE_GFX_VERSION permite, em alguns casos, forçar o reconhecimento de uma GPU semelhante a um modelo compatível. Uso reservado a usuários experientes, sem garantia.
#Acesso a arquivos e integração com VS Code
Além do desempenho, muitas vezes é o acesso aos arquivos que determina a escolha. Os dois sistemas de arquivos (NTFS do Windows e ext4 do Linux no WSL2) podem ser acessados a partir do outro sistema, mas atravessar essa ponte tem um custo de desempenho, e as convenções de caminhos são diferentes.
- Do WSL2 para o Windows
- Seus discos Windows estão montados sob /mnt/c, /mnt/d, etc. Útil para ler uma pasta de documentos, mas lento para acessos intensivos (carregamento de grandes modelos, indexação RAG).
- De Windows para WSL2
- O sistema de arquivos Linux pode ser acessado pelo caminho de rede \\wsl$\Ubuntu\ no Explorador de Arquivos. É útil para colocar um arquivo ali, mas evite executar ferramentas do Windows de forma intensiva nesse local.
- Regra de ouro
- Mantenha cada carga de trabalho no seu sistema de arquivos nativo. Projeto de desenvolvimento Linux → no WSL2. Documentos de escritório → no Windows. Assim, você evita a ponte lenta.
No VS Code, a integração com WSL é excelente e favorece fortemente o WSL2 para uso de desenvolvimento. A extensão oficial "WSL" abre um projeto diretamente na distribuição: o servidor do VS Code roda no Linux, o terminal integrado é um shell Linux e seu código de chamada à API Ollama é executado no mesmo ambiente que o daemon.
#Qual é a configuração recomendada para o seu uso
Aqui está a síntese prática. Escolha com base no seu perfil predominante, em vez de microdiferenças de tokens por segundo.
- Uso em desktop / público geral (NVIDIA)
- Ollama nativo para Windows. Instalação em um clique, inicialização ao entrar na sessão, nenhuma camada Linux para manter. Perfeito com LM Studio ou Open WebUI como interface.
- Desenvolvedor Linux / stack Unix
- Ollama no WSL2. Você tem suas ferramentas (scripts bash, Docker, Python venv) no mesmo ambiente do daemon, com uma integração exemplar com o VS Code.
- GPU AMD para o público em geral
- Teste primeiro a versão nativa para Windows: geralmente é a mais simples de colocar em funcionamento com a ROCm integrada. Passe para WSL2 apenas se seu fluxo de trabalho exigir isso e sua placa tiver suporte.
- Servidor / compartilhamento pela rede
- O WSL2 se aproxima de uma implantação convencional em servidor Linux e facilita a reprodutibilidade (os mesmos comandos usados em produção). Lembre-se de OLLAMA_HOST para expô-lo.
#Solução de problemas
- « ollama ps » exibe CPU em vez de GPU
- Sob WSL2, verifique se « nvidia-smi » responde. Se não, atualize o driver do lado do Windows e não instale nenhum driver Linux na distribuição.
- Carregamento do modelo muito lento
- Seus modelos estão provavelmente armazenados em /mnt/c. Mova-os para o sistema de arquivos Linux (~/.ollama) para recuperar a velocidade.
- « address already in use » na porta 11434
- Um Ollama nativo e um Ollama WSL2 rodam ao mesmo tempo. Pare um deles ou mude a porta do outro com OLLAMA_HOST=127.0.0.1:11435.
- GPU AMD ignorada
- Placa fora da lista do ROCm. Verifique a compatibilidade, tente HSA_OVERRIDE_GFX_VERSION se for o caso ou recorra à execução nativa no Windows.
- O cliente Windows não consegue se conectar ao daemon WSL2
- Use http://localhost:11434 (o redirecionamento do WSL2 faz a ponte) e certifique-se de que apenas um daemon esteja escutando nessa porta.
#Para se aprofundar
Após escolher seu ambiente, esses guias irão ajudá-lo a tirar o máximo dele:
- Instalar o Ollama no Windows 11
- Passo a passo do instalador nativo, complementar a este comparativo se você optar pela via Windows.
- Solução de problemas do Ollama: GPU não detectada, lentidão, erros de memória
- Para saber mais sobre falhas de GPU, tanto na execução nativa quanto no WSL2.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para ajustar o uso de VRAM de acordo com sua placa, independentemente do ambiente.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.