Intermediário 12 minOllama

Ollama + GPU AMD (ROCm): configurar Radeon RX 6000 a 9000

A AMD ficou atrás do CUDA por muito tempo, mas o ROCm 6 recuperou terreno suficiente para que as Radeon RX 6000, 7000 e 9000 sejam plenamente utilizáveis para inferência de LLMs. Este guia aborda a instalação limpa, a configuração do Ollama e o override que permite rodar placas não listadas oficialmente.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que usar ROCm

Para usar o GPU AMD, o Ollama (que se baseia em llama.cpp) precisa usar o ROCm — o equivalente da AMD ao CUDA. Sem ROCm, a placa não é reconhecida para inferência e tudo roda no CPU.

i
Alternativa: Vulkan
Se o ROCm não cooperar, o llama.cpp compilado com Vulkan também funciona em GPUs AMD (e também Intel Arc). Um pouco mais lento, mas mais simples. Consultar o guia do llama.cpp com Vulkan.

#Placas oficialmente compatíveis

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
RX 7900 XTX / XT / GRE
gfx1100. Suporte oficial. Aproximadamente 80% do desempenho de uma RTX 4080.
RX 7800 / 7700 XT
gfx1101. Suporte oficial a partir do ROCm 6.1.
RX 6900 / 6800 / 6700 XT
gfx1030/1031. Suporte oficial para as placas maiores, override para as menores.
Instinct MI200 / MI300
Placas para data centers. Suporte nativo completo.
!
RX 6600, 6500, 5700
Não são oficialmente suportadas. Tudo é possível com a variável HSA_OVERRIDE_GFX_VERSION (ver abaixo), mas por sua conta e risco.

#1. Instalar o ROCm

As duas distribuições melhor suportadas são Ubuntu 22.04/24.04 e RHEL/Fedora. Versões Debian, Arch e similares exigem ajustes adicionais.

Ubuntu 24.04
# Dépôt officiel
wget https://repo.radeon.com/amdgpu-install/6.1/ubuntu/noble/amdgpu-install_6.1.60100-1_all.deb
sudo apt install ./amdgpu-install_6.1.60100-1_all.deb

# ROCm + drivers GPU
sudo amdgpu-install --usecase=rocm,graphics

# Droits utilisateur
sudo usermod -aG render,video $USER

# Reboot obligatoire
sudo reboot
Verificação pós-reinicialização
rocminfo | grep gfx
# Doit afficher votre architecture, ex : gfx1100

rocm-smi
# Résumé VRAM, température, conso

#2. Ollama e ROCm

Ollama 0.3+ detecta automaticamente o ROCm. Se você instalou Ollama ANTES do ROCm, reinstale — o script detecta então a placa AMD e instala as bibliotecas corretas.

Reinstalar após ROCm
curl -fsSL https://ollama.com/install.sh | sh
systemctl restart ollama
Testar
ollama run qwen3.5:9b "Test GPU"
# Puis dans un autre terminal :
rocm-smi --showuse
# La ligne GPU[0] doit bouger

#3. Forçar uma placa não suportada

Se o rocminfo não listar sua GPU ou se o Ollama continuar usando a CPU, a variável HSA_OVERRIDE_GFX_VERSION força o ROCm a fingir.

RX 6600 / 6700
HSA_OVERRIDE_GFX_VERSION=10.3.0
RX 5700 XT
HSA_OVERRIDE_GFX_VERSION=10.1.0 (suporte frágil)
RX 6800 / 6900
Suportadas nativamente, sem necessidade de override.
No override do serviço Ollama no systemd
sudo systemctl edit ollama

# Ajouter :
[Service]
Environment="HSA_OVERRIDE_GFX_VERSION=10.3.0"

sudo systemctl daemon-reload
sudo systemctl restart ollama

#4. Desempenho esperado

Com o Qwen 3.5 9B Q4_K_M (6,6 GB, a escolha de referência para 8 GB de VRAM em 2026), os valores aproximados em tokens por segundo durante a inferência são:

RX 7900 XTX (24 GB)
~90 tok/s. Comparável a uma RTX 4080.
RX 7800 XT (16 GB)
~62 tok/s. Entre RTX 4070 e 4070 Ti.
RX 6900 XT (16 GB)
~52 tok/s. Equivalente à RTX 3080 10 GB.
RX 6700 XT (12 GB, override)
~33 tok/s. Entre RTX 3060 e 3060 Ti.
→
A VRAM é rainha
Tanto nas placas AMD quanto nas NVIDIA, é a VRAM que abre a porta para modelos grandes. Uma RX 7900 XTX de 24 GB executa o Qwen 3.6 35B-A3B (23 GB em Q4), que uma RTX 4070 de 12 GB não consegue carregar, mesmo que a 4070 seja mais rápida em capacidade de cálculo pura.

#Solução de problemas

rocminfo está vazio
Drivers não instalados ou usuário fora do grupo render. Verifique groups $USER.
Ollama utiliza o CPU apesar do ROCm
Muitas vezes há incompatibilidade de arquitetura. Tente o HSA_OVERRIDE correspondente à geração acima.
Crash com modelos grandes (OOM)
rocm-smi para ver o consumo de VRAM. Se você ultrapassar a capacidade disponível, reduza num_ctx ou mude para Q3_K_M.
Versão do ROCm incompatível com o Ollama
Ollama empacotado para ROCm 6.x. O ROCm 5 não funciona. Atualize.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.