Ollama + GPU AMD (ROCm): configurar Radeon RX 6000 a 9000
A AMD ficou atrás do CUDA por muito tempo, mas o ROCm 6 recuperou terreno suficiente para que as Radeon RX 6000, 7000 e 9000 sejam plenamente utilizáveis para inferência de LLMs. Este guia aborda a instalação limpa, a configuração do Ollama e o override que permite rodar placas não listadas oficialmente.
#Por que usar ROCm
Para usar o GPU AMD, o Ollama (que se baseia em llama.cpp) precisa usar o ROCm — o equivalente da AMD ao CUDA. Sem ROCm, a placa não é reconhecida para inferência e tudo roda no CPU.
#Placas oficialmente compatíveis
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- RX 7900 XTX / XT / GRE
- gfx1100. Suporte oficial. Aproximadamente 80% do desempenho de uma RTX 4080.
- RX 7800 / 7700 XT
- gfx1101. Suporte oficial a partir do ROCm 6.1.
- RX 6900 / 6800 / 6700 XT
- gfx1030/1031. Suporte oficial para as placas maiores, override para as menores.
- Instinct MI200 / MI300
- Placas para data centers. Suporte nativo completo.
#1. Instalar o ROCm
As duas distribuições melhor suportadas são Ubuntu 22.04/24.04 e RHEL/Fedora. Versões Debian, Arch e similares exigem ajustes adicionais.
#2. Ollama e ROCm
Ollama 0.3+ detecta automaticamente o ROCm. Se você instalou Ollama ANTES do ROCm, reinstale — o script detecta então a placa AMD e instala as bibliotecas corretas.
#3. Forçar uma placa não suportada
Se o rocminfo não listar sua GPU ou se o Ollama continuar usando a CPU, a variável HSA_OVERRIDE_GFX_VERSION força o ROCm a fingir.
- RX 6600 / 6700
- HSA_OVERRIDE_GFX_VERSION=10.3.0
- RX 5700 XT
- HSA_OVERRIDE_GFX_VERSION=10.1.0 (suporte frágil)
- RX 6800 / 6900
- Suportadas nativamente, sem necessidade de override.
#4. Desempenho esperado
Com o Qwen 3.5 9B Q4_K_M (6,6 GB, a escolha de referência para 8 GB de VRAM em 2026), os valores aproximados em tokens por segundo durante a inferência são:
- RX 7900 XTX (24 GB)
- ~90 tok/s. Comparável a uma RTX 4080.
- RX 7800 XT (16 GB)
- ~62 tok/s. Entre RTX 4070 e 4070 Ti.
- RX 6900 XT (16 GB)
- ~52 tok/s. Equivalente à RTX 3080 10 GB.
- RX 6700 XT (12 GB, override)
- ~33 tok/s. Entre RTX 3060 e 3060 Ti.
#Solução de problemas
- rocminfo está vazio
- Drivers não instalados ou usuário fora do grupo render. Verifique groups $USER.
- Ollama utiliza o CPU apesar do ROCm
- Muitas vezes há incompatibilidade de arquitetura. Tente o HSA_OVERRIDE correspondente à geração acima.
- Crash com modelos grandes (OOM)
- rocm-smi para ver o consumo de VRAM. Se você ultrapassar a capacidade disponível, reduza num_ctx ou mude para Q3_K_M.
- Versão do ROCm incompatível com o Ollama
- Ollama empacotado para ROCm 6.x. O ROCm 5 não funciona. Atualize.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.