Intermediário 11 minRadeon RX 9000

Qual LLM para Radeon RX 9070 (16 GB) ?

Resposta direta

A Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) executa modelos com entre 20 e 24 bilhões de parâmetros em Q4 e gera cerca de 120 tokens por segundo no Llama 2 7B em Q4_0 com Vulkan, de acordo com uma medição pública. No Linux, o Ollama oferece suporte a ela com ROCm v7; no Windows, ela não está na lista de placas compatíveis com ROCm do Ollama e usa Vulkan, que já apresenta bons resultados.

A RX 9070 é a mais recente das placas de 16 GB da AMD nesse nível de preço, com consumo significativamente menor que as anteriores da série RX 7000. Este guia mostra o que ela executa, o que se sabe sobre sua velocidade com base em medições públicas, as diferenças entre Linux e Windows, e onde ela se situa em relação à RX 9070 XT e às RTX de 16 GB.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Para este setup: Radeon RX 9070 XT 16 GB.

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que a RX 9070 faz em 2026

A RX 9070 carrega sem problemas modelos de 8 a 14 bilhões de parâmetros em Q4 e aceita modelos de 20 a 24 bilhões, com contexto curto para os maiores. Sua memória de 16 GB GDDR6 a 20,1 Gb/s em um barramento de 256 bits oferece 640 GB/s de largura de banda, valor que corrige o da versão antiga desta página (644). Para Llama 2 7B em Q4_0, a discussão pública no repositório llama.cpp informa 119,71 tokens por segundo na geração com Vulkan e 114,48 com ROCm, com leitura de prompt a 3.164 tokens por segundo com Vulkan, mais rápida que nas RX 7800 XT e 7900 GRE. Outro ponto forte é seu TDP de 220 W, 40 a 50 W inferior ao dos modelos anteriores de 16 GB.

Arquitetura
RDNA 4, chip da série RX 9000, com o mesmo barramento de 256 bits que a 9070 XT.
Cálculo
3.584 processadores de fluxo (4.096 para a 9070 XT).
Memória
16 GB GDDR6, 20,1 Gb/s, barramento de 256 bits, 640 GB/s.
Consumo
TDP de 220 W (304 W para a 9070 XT).
Preço
Não é indicado: muda a cada semana; veja /prix-gpu-ia.

#Linux, Windows: ROCm ou Vulkan

Essa é a particularidade da geração RDNA 4: o suporte varia conforme o sistema. A AMD lista a RX 9070 no ROCm (alvo gfx1201), e a documentação do Ollama a menciona para Linux, com o driver ROCm v7. Para Windows, porém, a lista ROCm do Ollama vai apenas até a RX 7900 XTX; a RX 9070 não consta nela. Ela continua podendo ser usada via Vulkan, ativado por padrão, que também apresenta boas taxas de transferência. Por fim, a documentação da AMD especifica que as Radeon RX 9000 têm suporte apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7.

Suporte à RX 9070
AmbienteStatusConsequência prática
Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)ROCm oficial, alvo gfx1201Ollama com driver ROCm v7
WindowsAusente da lista ROCm de OllamaUsar Vulkan, ativado por padrão
Vulkan, todos os sistemasCaminho de uso geralTaxas comparáveis às do ROCm nas medições públicas
i
Uma divergência que você precisa conhecer
A tabela de alvos da documentação do Ollama apresenta gfx1200 para a RX 9070 e gfx1201 para a 9070 XT como exemplo, enquanto a tabela da AMD associa a RX 9070 a gfx1201. Confie no comando rocminfo na sua máquina, não em um exemplo da documentação.

#O que cabe em 16 GB de VRAM

Conte com cerca de 15 GB para o modelo e seu cache KV quando a placa não estiver sendo usada para exibir a imagem na tela. O catálogo QuelLLM informa abaixo o tamanho dos pesos em Q4; o contexto ocupa memória adicional.

O que cabe em uma RX 9070 (apenas os pesos)
ModeloTamanho do modeloMargem para o contextoVeredito
Llama 3.1 8B em Q4≈ 6 GB≈ 9 GBMuito confortável, contexto muito longo
Gemma 4 12B em Q8≈ 13 GB≈ 2 GBCabe, contexto curto
gpt-oss 20B em Q4≈ 13 GB≈ 2 GBCabe, com contexto curto a médio
Devstral Small 2 24B em Q4≈ 14 GB≈ 1 GBCabe, mas com pouca folga
Gemma 4 26B-A4B em Q4≈ 16 GBnenhumaApertado demais

Esses 16 GB são o limite entre um modelo de 24B, que cabe, e modelos de 26 a 30B, que já não cabem. Para esse limite específico, as placas de 16 GB de todas as marcas se equivalem: a página por VRAM faz essa comparação. O que diferencia a RX 9070 é o que ela oferece além dessa capacidade: uma leitura de prompt mais rápida e um consumo mais baixo.

#Taxas medidas: Vulkan à frente do ROCm

Os números vêm das discussões públicas do repositório llama.cpp, todas usando Llama 2 7B em Q4_0 (3,56 GiB) e llama-bench; não são medições realizadas pelo site. Na RX 9070, Vulkan alcança 3.164,10 tokens por segundo na leitura e 119,71 na geração; com Flash Attention, 2.859,98 e 119,51. ROCm alcança 2.381,77 e 114,48. Os dois backends são próximos na geração, com Vulkan ligeiramente à frente, e a diferença é mais clara na leitura do prompt. Configurações, drivers e commits variam de uma série para outra: interprete essas diferenças como ordens de grandeza.

RX 9070 no Llama 2 7B Q4_0 (medições públicas do llama.cpp)
BackendFlash AttentionLeitura pp512Geração tg128
Vulkannão3 164,10 t/s119,71 t/s
Vulkansim2 859,98 t/s119,51 t/s
ROCmnão2 381,77 t/s114,48 t/s

O limite teórico de geração é de 640 GB/s divididos por 3,82 GB, ou seja, cerca de 167 tokens por segundo; a placa atinge 71% desse limite usando Vulkan. Aplicar esse rendimento a modelos maiores fornece estimativas de ordem de grandeza. São cálculos, não medições, e pressupõem que um modelo maior se comporte como o modelo de referência de 7B.

Estimativa de 71 % do limite de 640 GB/s (cálculo, não medição)
Modelo (Q4)Tamanho do modeloLimite teóricaOrdem de grandeza
Llama 3.1 8B≈ 6 GB≈ 107 tokens/s≈ 76 tokens/s
Gemma 4 12B≈ 7 GB≈ 91 tokens/s≈ 65 tokens/s
Phi-4 14B≈ 9 GB≈ 71 tokens/s≈ 50 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 46 tokens/s≈ 32 tokens/s

#O que o RDNA 4 muda para um LLM local

RDNA 4 adiciona hardware dedicado à IA: a RX 9070 embarca 112 aceleradores de IA de acordo com a ficha da série, contra 128 para a RX 9070 XT. Poderíamos esperar taxas de geração muito superiores às do RDNA 3. As medições públicas não mostram isso: 119,71 tokens por segundo para a RX 9070 sob Vulkan, contra 118,27 para a RX 7800 XT na mesma discussão. A geração de um LLM é limitada pela largura de banda da memória, e 640 GB/s não são muito diferentes dos 624 GB/s da 7800 XT. Os aceleradores de IA ajudam mais na leitura do prompt, onde a RX 9070 ganha 57% em relação à 7800 XT.

A consequência para o comprador: não pague pela RDNA 4 em busca de velocidade na conversa; pague por ela pela leitura dos prompts, pelo consumo mais baixo e pela longevidade do suporte de software, que continuará atendendo às placas recentes por mais tempo do que às antigas. Se você usa um chat com um modelo de 8 a 14B, uma RX 7800 XT usada oferece resultados de geração semelhantes.

#Diante da RX 9070 XT: a diferença é maior que «10 %»

A versão anterior desta página informava que a RX 9070 era 10 a 12% mais lenta que a 9070 XT. No modelo de referência de 7B com Vulkan, a 9070 XT gera 137,11 tokens por segundo contra 119,71, ou seja, 15% a mais, e lê os prompts a 5.036 tokens por segundo contra 3.164, ou seja, 59% a mais. As duas placas, no entanto, têm a mesma memória, 16 GB, e a mesma largura de banda, segundo suas fichas técnicas. A diferença vem, portanto, da capacidade de cálculo (4.096 processadores de fluxo contra 3.584), que pesa pouco na geração e muito na leitura de prompts.

RX 9070 e RX 9070 XT sob Vulkan (Llama 2 7B Q4_0, sem FA)
CritérioRX 9070RX 9070 XT
Processadores de fluxo3 5844 096
TDP220 W304 W
Leitura pp5123 164,10 t/s5 036,04 t/s
Geração tg128119,71 t/s137,11 t/s

Em termos claros: para o chat, a 9070 perde 15% de velocidade em troca de 84 W a menos, uma compensação razoável. Para o RAG e documentos longos, a 9070 XT lê cerca de 1,6 vezes mais rápido.

#Em comparação com as RTX de 16 GB: o prompt continua sendo o ponto fraco

Em comparação com as placas NVIDIA de 16 GB avaliadas com Vulkan, a RX 9070 gera um pouco mais devagar: 8% abaixo da RTX 4070 Ti Super e 12% abaixo da RTX 5070 Ti, e lê o prompt a aproximadamente metade da velocidade. A RTX 5070 de 12 GB, frequentemente citada como concorrente direta, não aparece na discussão de referência sobre Vulkan: portanto, não há comparação numérica confiável com ela, apenas a diferença de capacidade, 16 GB contra 12 GB.

RX 9070 e RTX de 16 GB sob Vulkan (Llama 2 7B Q4_0, sem FA)
PlacaLeitura pp512Geração tg128
RX 90703 164,10 t/s119,71 t/s
RTX 4070 Ti Super6 099,18 t/s129,45 t/s
RTX 5070 Ti6 213,63 t/s135,63 t/s

#Configuração inicial

  1. 01
    Escolher o sistema
    No Linux, use Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 ou RHEL 9.7 para permanecer no escopo de suporte da AMD. No Windows, conte com Vulkan.
  2. 02
    Instalar Ollama
    No Linux, instale o driver ROCm v7 com amdgpu-install e depois o Ollama. No Windows, instale o Ollama: o Vulkan está ativado por padrão.
  3. 03
    Carregar um modelo
    Use um modelo de 12B ou 20B antes de um de 24B e depois verifique com ollama ps se o modelo está 100% na GPU.
  4. 04
    Comparar os backends
    Execute o llama-bench com Vulkan e depois com ROCm no seu modelo: nas medições públicas, o Vulkan está ligeiramente à frente.
Terminal
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Vale a pena esperar uma próxima geração? Nada nas medições citadas justifica esperar para usar modelos de 8 a 24B: o limite é a capacidade de 16 GB, que só uma placa de 20 a 24 GB elimina. Se você já sabe que quer modelos de 30B ou mais, descarte essa placa; caso contrário, a compra de uma placa de 16 GB se justifica pelo que você executa hoje, não pelo que será lançado amanhã.

#Veredito 2026

Uma boa escolha
Se você quer 16 GB em uma placa de baixo consumo (220 W) e aceita Vulkan no Windows.
Prefira a 9070 XT
Se seus prompts forem longos: a leitura é 59 % mais rápida, com 84 W a mais.
Prefira uma RTX de 16 GB
Se você precisa de CUDA ou de uma leitura de prompt duas vezes mais rápida.

Os preços mudam rapidamente: o acompanhamento do site registra, toda segunda-feira e toda quinta-feira, o menor preço das placas de vídeo para IA local, junto com o preço por GB de VRAM. É esse último valor que deve orientar a comparação com a RTX 5070 ou a RX 9070 XT.

#Perguntas frequentes

FAQ
RX 9070 ou RX 9070 XT para um LLM local?+
A 9070 XT gera 15% mais rápido e lê os prompts 59% mais rápido no modelo 7B de referência usando Vulkan, ao custo de um TDP de 304 W contra 220 W. Para bate-papo, a 9070 é suficiente; para RAG e documentos longos, a XT se justifica. Compare os preços atuais.
RX 9070 ou RTX 5070 para um LLM local?+
A RX 9070 oferece 16 GB contra 12 GB, o que permite rodar modelos com 20 a 24 bilhões de parâmetros. A RTX 5070 mantém o ecossistema CUDA e uma leitura de prompt mais rápida. Nenhuma medição pública da RTX 5070 com Vulkan foi encontrada: a comparação quantitativa, portanto, ainda precisa ser feita.
A RX 9070 é suportada pelo Ollama?+
No Linux, sim, com o driver ROCm v7: a placa está na lista do Ollama. No Windows, ela não está na lista ROCm do Ollama, que vai até a RX 7900 XTX, mas o Vulkan, ativado por padrão, permite usá-la. Verifique com ollama ps se o modelo está carregado na GPU.
Quantos tokens por segundo uma RX 9070 gera?+
No Llama 2 7B em Q4_0, as discussões públicas no repositório llama.cpp indicam 119,71 tokens por segundo com Vulkan e 114,48 com ROCm na geração. Para um modelo de 24B em Q4, o cálculo dá cerca de 32 tokens por segundo: uma estimativa para você medir em sua própria máquina.
Quais modelos podem ser rodados em uma RX 9070 de 16 GB?+
Llama 3.1 8B, Gemma 4 12B até Q8, gpt-oss 20B e Devstral Small 2 24B em Q4, esses dois últimos com contexto curto. Um modelo de 26 a 30B em Q4 ultrapassa os 16 GB de VRAM e passa a ser executado parcialmente no processador, com uma redução significativa de velocidade.
Vulkan ou ROCm na RX 9070?+
Nas medições públicas do repositório llama.cpp, Vulkan gera um pouco mais rápido (119,71 contra 114,48 tokens por segundo) e lê o prompt mais rápido (3 164 contra 2 382). No Windows, Vulkan é, de qualquer forma, o caminho padrão. Teste os dois com o seu modelo antes de decidir.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.