Qual LLM para Radeon RX 9070 (16 GB) ?
A Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) executa modelos com entre 20 e 24 bilhões de parâmetros em Q4 e gera cerca de 120 tokens por segundo no Llama 2 7B em Q4_0 com Vulkan, de acordo com uma medição pública. No Linux, o Ollama oferece suporte a ela com ROCm v7; no Windows, ela não está na lista de placas compatíveis com ROCm do Ollama e usa Vulkan, que já apresenta bons resultados.
A RX 9070 é a mais recente das placas de 16 GB da AMD nesse nível de preço, com consumo significativamente menor que as anteriores da série RX 7000. Este guia mostra o que ela executa, o que se sabe sobre sua velocidade com base em medições públicas, as diferenças entre Linux e Windows, e onde ela se situa em relação à RX 9070 XT e às RTX de 16 GB.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Para este setup: Radeon RX 9070 XT 16 GB.
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que a RX 9070 faz em 2026
A RX 9070 carrega sem problemas modelos de 8 a 14 bilhões de parâmetros em Q4 e aceita modelos de 20 a 24 bilhões, com contexto curto para os maiores. Sua memória de 16 GB GDDR6 a 20,1 Gb/s em um barramento de 256 bits oferece 640 GB/s de largura de banda, valor que corrige o da versão antiga desta página (644). Para Llama 2 7B em Q4_0, a discussão pública no repositório llama.cpp informa 119,71 tokens por segundo na geração com Vulkan e 114,48 com ROCm, com leitura de prompt a 3.164 tokens por segundo com Vulkan, mais rápida que nas RX 7800 XT e 7900 GRE. Outro ponto forte é seu TDP de 220 W, 40 a 50 W inferior ao dos modelos anteriores de 16 GB.
- Arquitetura
- RDNA 4, chip da série RX 9000, com o mesmo barramento de 256 bits que a 9070 XT.
- Cálculo
- 3.584 processadores de fluxo (4.096 para a 9070 XT).
- Memória
- 16 GB GDDR6, 20,1 Gb/s, barramento de 256 bits, 640 GB/s.
- Consumo
- TDP de 220 W (304 W para a 9070 XT).
- Preço
- Não é indicado: muda a cada semana; veja /prix-gpu-ia.
#Linux, Windows: ROCm ou Vulkan
Essa é a particularidade da geração RDNA 4: o suporte varia conforme o sistema. A AMD lista a RX 9070 no ROCm (alvo gfx1201), e a documentação do Ollama a menciona para Linux, com o driver ROCm v7. Para Windows, porém, a lista ROCm do Ollama vai apenas até a RX 7900 XTX; a RX 9070 não consta nela. Ela continua podendo ser usada via Vulkan, ativado por padrão, que também apresenta boas taxas de transferência. Por fim, a documentação da AMD especifica que as Radeon RX 9000 têm suporte apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7.
| Ambiente | Status | Consequência prática |
|---|---|---|
| Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | ROCm oficial, alvo gfx1201 | Ollama com driver ROCm v7 |
| Windows | Ausente da lista ROCm de Ollama | Usar Vulkan, ativado por padrão |
| Vulkan, todos os sistemas | Caminho de uso geral | Taxas comparáveis às do ROCm nas medições públicas |
#O que cabe em 16 GB de VRAM
Conte com cerca de 15 GB para o modelo e seu cache KV quando a placa não estiver sendo usada para exibir a imagem na tela. O catálogo QuelLLM informa abaixo o tamanho dos pesos em Q4; o contexto ocupa memória adicional.
| Modelo | Tamanho do modelo | Margem para o contexto | Veredito |
|---|---|---|---|
| Llama 3.1 8B em Q4 | ≈ 6 GB | ≈ 9 GB | Muito confortável, contexto muito longo |
| Gemma 4 12B em Q8 | ≈ 13 GB | ≈ 2 GB | Cabe, contexto curto |
| gpt-oss 20B em Q4 | ≈ 13 GB | ≈ 2 GB | Cabe, com contexto curto a médio |
| Devstral Small 2 24B em Q4 | ≈ 14 GB | ≈ 1 GB | Cabe, mas com pouca folga |
| Gemma 4 26B-A4B em Q4 | ≈ 16 GB | nenhuma | Apertado demais |
Esses 16 GB são o limite entre um modelo de 24B, que cabe, e modelos de 26 a 30B, que já não cabem. Para esse limite específico, as placas de 16 GB de todas as marcas se equivalem: a página por VRAM faz essa comparação. O que diferencia a RX 9070 é o que ela oferece além dessa capacidade: uma leitura de prompt mais rápida e um consumo mais baixo.
#Taxas medidas: Vulkan à frente do ROCm
Os números vêm das discussões públicas do repositório llama.cpp, todas usando Llama 2 7B em Q4_0 (3,56 GiB) e llama-bench; não são medições realizadas pelo site. Na RX 9070, Vulkan alcança 3.164,10 tokens por segundo na leitura e 119,71 na geração; com Flash Attention, 2.859,98 e 119,51. ROCm alcança 2.381,77 e 114,48. Os dois backends são próximos na geração, com Vulkan ligeiramente à frente, e a diferença é mais clara na leitura do prompt. Configurações, drivers e commits variam de uma série para outra: interprete essas diferenças como ordens de grandeza.
| Backend | Flash Attention | Leitura pp512 | Geração tg128 |
|---|---|---|---|
| Vulkan | não | 3 164,10 t/s | 119,71 t/s |
| Vulkan | sim | 2 859,98 t/s | 119,51 t/s |
| ROCm | não | 2 381,77 t/s | 114,48 t/s |
O limite teórico de geração é de 640 GB/s divididos por 3,82 GB, ou seja, cerca de 167 tokens por segundo; a placa atinge 71% desse limite usando Vulkan. Aplicar esse rendimento a modelos maiores fornece estimativas de ordem de grandeza. São cálculos, não medições, e pressupõem que um modelo maior se comporte como o modelo de referência de 7B.
| Modelo (Q4) | Tamanho do modelo | Limite teórica | Ordem de grandeza |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 107 tokens/s | ≈ 76 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 91 tokens/s | ≈ 65 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 71 tokens/s | ≈ 50 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 46 tokens/s | ≈ 32 tokens/s |
#O que o RDNA 4 muda para um LLM local
RDNA 4 adiciona hardware dedicado à IA: a RX 9070 embarca 112 aceleradores de IA de acordo com a ficha da série, contra 128 para a RX 9070 XT. Poderíamos esperar taxas de geração muito superiores às do RDNA 3. As medições públicas não mostram isso: 119,71 tokens por segundo para a RX 9070 sob Vulkan, contra 118,27 para a RX 7800 XT na mesma discussão. A geração de um LLM é limitada pela largura de banda da memória, e 640 GB/s não são muito diferentes dos 624 GB/s da 7800 XT. Os aceleradores de IA ajudam mais na leitura do prompt, onde a RX 9070 ganha 57% em relação à 7800 XT.
A consequência para o comprador: não pague pela RDNA 4 em busca de velocidade na conversa; pague por ela pela leitura dos prompts, pelo consumo mais baixo e pela longevidade do suporte de software, que continuará atendendo às placas recentes por mais tempo do que às antigas. Se você usa um chat com um modelo de 8 a 14B, uma RX 7800 XT usada oferece resultados de geração semelhantes.
#Diante da RX 9070 XT: a diferença é maior que «10 %»
A versão anterior desta página informava que a RX 9070 era 10 a 12% mais lenta que a 9070 XT. No modelo de referência de 7B com Vulkan, a 9070 XT gera 137,11 tokens por segundo contra 119,71, ou seja, 15% a mais, e lê os prompts a 5.036 tokens por segundo contra 3.164, ou seja, 59% a mais. As duas placas, no entanto, têm a mesma memória, 16 GB, e a mesma largura de banda, segundo suas fichas técnicas. A diferença vem, portanto, da capacidade de cálculo (4.096 processadores de fluxo contra 3.584), que pesa pouco na geração e muito na leitura de prompts.
| Critério | RX 9070 | RX 9070 XT |
|---|---|---|
| Processadores de fluxo | 3 584 | 4 096 |
| TDP | 220 W | 304 W |
| Leitura pp512 | 3 164,10 t/s | 5 036,04 t/s |
| Geração tg128 | 119,71 t/s | 137,11 t/s |
Em termos claros: para o chat, a 9070 perde 15% de velocidade em troca de 84 W a menos, uma compensação razoável. Para o RAG e documentos longos, a 9070 XT lê cerca de 1,6 vezes mais rápido.
#Em comparação com as RTX de 16 GB: o prompt continua sendo o ponto fraco
Em comparação com as placas NVIDIA de 16 GB avaliadas com Vulkan, a RX 9070 gera um pouco mais devagar: 8% abaixo da RTX 4070 Ti Super e 12% abaixo da RTX 5070 Ti, e lê o prompt a aproximadamente metade da velocidade. A RTX 5070 de 12 GB, frequentemente citada como concorrente direta, não aparece na discussão de referência sobre Vulkan: portanto, não há comparação numérica confiável com ela, apenas a diferença de capacidade, 16 GB contra 12 GB.
| Placa | Leitura pp512 | Geração tg128 |
|---|---|---|
| RX 9070 | 3 164,10 t/s | 119,71 t/s |
| RTX 4070 Ti Super | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 6 213,63 t/s | 135,63 t/s |
#Configuração inicial
- 01Escolher o sistemaNo Linux, use Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 ou RHEL 9.7 para permanecer no escopo de suporte da AMD. No Windows, conte com Vulkan.
- 02Instalar OllamaNo Linux, instale o driver ROCm v7 com amdgpu-install e depois o Ollama. No Windows, instale o Ollama: o Vulkan está ativado por padrão.
- 03Carregar um modeloUse um modelo de 12B ou 20B antes de um de 24B e depois verifique com ollama ps se o modelo está 100% na GPU.
- 04Comparar os backendsExecute o llama-bench com Vulkan e depois com ROCm no seu modelo: nas medições públicas, o Vulkan está ligeiramente à frente.
Vale a pena esperar uma próxima geração? Nada nas medições citadas justifica esperar para usar modelos de 8 a 24B: o limite é a capacidade de 16 GB, que só uma placa de 20 a 24 GB elimina. Se você já sabe que quer modelos de 30B ou mais, descarte essa placa; caso contrário, a compra de uma placa de 16 GB se justifica pelo que você executa hoje, não pelo que será lançado amanhã.
#Veredito 2026
- Uma boa escolha
- Se você quer 16 GB em uma placa de baixo consumo (220 W) e aceita Vulkan no Windows.
- Prefira a 9070 XT
- Se seus prompts forem longos: a leitura é 59 % mais rápida, com 84 W a mais.
- Prefira uma RTX de 16 GB
- Se você precisa de CUDA ou de uma leitura de prompt duas vezes mais rápida.
Os preços mudam rapidamente: o acompanhamento do site registra, toda segunda-feira e toda quinta-feira, o menor preço das placas de vídeo para IA local, junto com o preço por GB de VRAM. É esse último valor que deve orientar a comparação com a RTX 5070 ou a RX 9070 XT.
- Preços das placas gráficas para IA local, atualizados duas vezes por semana
- Documentação Ollama: placas AMD suportadas
- Compatibilidade de GPU do ROCm, documentação da AMD
- Placar Vulkan do repositório llama.cpp
#Perguntas frequentes
RX 9070 ou RX 9070 XT para um LLM local?+
RX 9070 ou RTX 5070 para um LLM local?+
A RX 9070 é suportada pelo Ollama?+
Quantos tokens por segundo uma RX 9070 gera?+
Quais modelos podem ser rodados em uma RX 9070 de 16 GB?+
Vulkan ou ROCm na RX 9070?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.