Intermediário 11 minRadeon RX 7000

Qual LLM para Radeon RX 7900 XT (20 GB) ?

Resposta direta

A Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s, 315 W) carrega modelos de 24 a 26 bilhões de parâmetros em Q4 sem precisar transferir parte deles para a RAM do sistema, com uma janela de contexto confortável, e ainda comporta um 30B ao custo de um contexto curto. É a memória, não a velocidade, que a diferencia: no Llama 2 7B, as medições públicas indicam 123 tokens por segundo com Vulkan, pouco mais que uma RX 7800 XT de 16 GB e muito abaixo da RX 7900 XTX.

Vinte gigabytes de VRAM é uma capacidade rara em uma placa voltada ao consumidor, e essa capacidade muda o que podemos executar: é a diferença entre um modelo de 24B apertado na memória e um de 24B com espaço para contexto. Este guia separa o que esses 20 GB realmente oferecem do que a largura de banda de 800 GB/s permite esperar, com medições públicas citadas e correções de ideias equivocadas sobre essa placa.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: Radeon RX 9070 XT 16 GB.

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que faz uma RX 7900 XT em 2026

A RX 7900 XT atende a quem quer modelos de 24 a 26 bilhões de parâmetros sem limitar o contexto. Seus 20 GB acomodam o Devstral Small 2 24B (cerca de 14 GB em Q4) com 6 GB de margem, contra 1 GB em uma placa de 16 GB, e o MoE Gemma 4 26B-A4B (cerca de 16 GB) com 4 GB de margem. Em termos de velocidade, porém, ela decepciona quem conta com seus 800 GB/s: 123,18 tokens por segundo no modelo de referência de 7B usando Vulkan, contra 118,27 em uma RX 7800 XT cuja largura de banda é 22% menor. A AMD a lista oficialmente no ROCm, e o Ollama oferece suporte a ela no Linux e no Windows.

Arquitetura
RDNA 3, Navi 31 com um GCD e cinco MCD, lançada em 13 de dezembro de 2022.
Cálculo
5.376 processadores de fluxo, 84 unidades de computação.
Memória
20 GB GDDR6, barramento de 320 bits, 800 GB/s.
Consumo
315 W de potência da placa: verifique a alimentação recomendada pelo fabricante do seu modelo.
Preço
Não é indicado aqui: consulte /prix-gpu-ia.

#O orçamento de memória de 20 GB

Conte com aproximadamente 19 GB para o modelo e seu cache KV quando a placa não estiver conectada à tela. A tabela subtrai desse orçamento o tamanho dos pesos em Q4 indicado no catálogo QuelLLM para mostrar a margem disponível para o contexto. Essa margem é o verdadeiro critério: um modelo que "cabe" com 1 GB de sobra fica limitado a um contexto de alguns milhares de tokens.

O que cabe em uma 7900 XT em Q4 (somente os pesos, com 19 GB disponíveis)
ModeloTamanho do modeloMargem para o contextoVeredito
gpt-oss 20B≈ 13 GB≈ 6 GBMuito confortável, contexto longo
Devstral Small 2 24B≈ 14 GB≈ 5 GBConfortável, contexto longo possível
Gemma 4 26B-A4B (MoE)≈ 16 GB≈ 3 GBCabe, contexto médio
Granite 4.1 30B≈ 17 GB≈ 2 GBCabe, contexto curto
Gemma 4 31B≈ 18 GB≈ 1 GBApertado, contexto muito curto

O caso dos modelos com especialistas merece uma observação. Apenas uma fração dos parâmetros de um MoE trabalha a cada token, o que torna a geração mais rápida do que a de um modelo denso de mesmo tamanho, mas todos os pesos precisam caber na memória. O 26B-A4B é o tipo de modelo para o qual 20 GB fazem a diferença: grande demais para 16 GB com contexto, mas com folga em 20 GB. Para modelos ainda maiores, como a família Qwen3.6 35B-A3B, consulte o guia dedicado em vez de adivinhar: o tamanho exato depende da quantização escolhida.

Para transformar a margem em número de tokens de contexto, é necessário conhecer o custo do cache KV por token, que depende da arquitetura do modelo: número de camadas, cabeças de atenção e precisão do cache. Não existe, portanto, uma regra universal em tokens por gigabyte. O método confiável é a medição: carregue o modelo com um contexto modesto, anote a VRAM ocupada com rocm-smi, aumente a janela e repita. A calculadora de VRAM do site automatiza essa estimativa para os modelos do catálogo, e a quantização do cache KV em 8 bits reduz aproximadamente pela metade a memória ocupada pelo contexto.

#Velocidades medidas: a largura de banda não é tudo

Os números vêm das discussões públicas do repositório llama.cpp, que usam Llama 2 7B em Q4_0 e llama-bench; não são medições feitas pelo site. Com Vulkan, a RX 7900 XT lê um prompt de 512 tokens a 2 941,58 tokens por segundo e gera a 123,18. Com Flash Attention, 2 701,13 e 120,62. Com ROCm, a discussão apresenta 3 098,38 em leitura e 116,15 em geração. As duas séries convergem: a geração tem um teto de cerca de 120 tokens por segundo.

O limite teórico da largura de banda, 800 GB/s divididos por 3,82 GB de pesos, é de aproximadamente 209 tokens por segundo; a placa atinge apenas 59% desse limite com Vulkan. É o rendimento mais baixo entre as placas AMD desta série de medições (83% para uma RX 6700 XT, 77% para uma RX 7900 GRE, 72% para uma RX 7800 XT). A explicação provável é que um modelo de 7 bilhões de parâmetros é pequeno demais para saturar a memória de um chip grande; pode-se esperar um rendimento melhor com modelos maiores, mas nenhuma medição dessas séries comprova isso, e seria imprudente anunciar taxas de geração para um 24B.

RX 7900 XT com Llama 2 7B Q4_0 (medições públicas do llama.cpp)
BackendFlash AttentionLeitura pp512Geração tg128
Vulkannão2 941,58 t/s123,18 t/s
Vulkansim2 701,13 t/s120,62 t/s
ROCmnão3 098,38 t/s116,15 t/s

Para obter uma ordem de grandeza para modelos grandes, uma estimativa conservadora consiste em aplicar o rendimento medido de 59 % ao limite teórico: um modelo de 24B em Q4 com 14 GB resulta em 800 divididos por 14, ou seja, um limite de cerca de 57 tokens por segundo e, portanto, aproximadamente 34 tokens por segundo. É um cálculo, não uma medição; se o rendimento for melhor em um modelo grande, a taxa real será superior.

#Em comparação com a RX 7900 XTX: a diferença real é muito maior do que se diz

Costuma-se ler que a 7900 XT é « 10 a 12% mais lenta » do que a 7900 XTX. As medições públicas contam outra história. No modelo de referência de 7B com Vulkan, a XTX gera 182,63 tokens por segundo, contra 123,18 da XT: 48% a mais. A proporção entre os números de processadores de fluxo (6.144 contra 5.376) não basta para explicar isso; são a largura de banda e o chip que ampliam a diferença. O que a XT preserva é o preço de entrada: com 20 GB, ela atende ao essencial das exigências dos modelos de 24 a 26B.

RX 7900 XT e RX 7900 XTX (Llama 2 7B Q4_0, medições públicas)
MediçãoRX 7900 XTRX 7900 XTX
VRAM20 GB24 GB
Vulkan, geração tg128123,18 t/s182,63 t/s
Vulkan, leitura pp5122 941,58 t/s3 726,99 t/s

Essa correção muda a escolha: se a velocidade de geração for importante para você, a diferença de 48% tem mais peso do que os 4 GB a mais de VRAM, enquanto, se você quiser sobretudo capacidade para o contexto, a XT oferece o essencial do que a XTX traz para um modelo de 24B. Em um modelo de 30B ou mais, por outro lado, os 24 GB da XTX eliminam a necessidade de fazer concessões quanto ao contexto, e é aí que a diferença de preço se justifica.

#Diante da RTX 4070 Ti Super: mais memória, menos velocidade

A RTX 4070 Ti Super oferece 16 GB, ou seja, 4 GB a menos. No modelo de referência de 7B com Vulkan, ela gera 129,45 tokens por segundo, ou seja, 5% a mais do que a RX 7900 XT, e lê o prompt a 6.099 tokens por segundo, duas vezes mais rápido. A XT não é, portanto, “mais rápida”, ao contrário do que às vezes se lê: ela tem mais memória. Seu argumento é a capacidade, que permite executar modelos de 24 a 26B com contexto.

RX 7900 XT e RTX 4070 Ti Super com Vulkan (Llama 2 7B Q4_0, sem FA)
CritérioRX 7900 XTRTX 4070 Ti Super
VRAM20 GB16 GB
Leitura pp5122 941,58 t/s6 099,18 t/s
Geração tg128123,18 t/s129,45 t/s

#Quando um modelo ultrapassa os 20 GB

Um modelo grande demais não causa erro: Ollama e llama.cpp colocam o máximo de camadas na placa e deixam o restante no processador. No llama.cpp, a opção -ngl define o número de camadas enviadas para a GPU, e o valor 100 usado nas medições acima significa “todas”. Reduzir esse valor libera VRAM, ao custo de uma geração mais lenta, pois cada token precisa então passar pela memória do sistema, muito mais lenta que a GDDR6. A regra prática: enquanto ollama ps exibir 100% GPU, você está na faixa rápida; assim que aparecer uma parcela no processador, a velocidade cai em etapas.

#20 GB, 16 GB ou 24 GB: como decidir

Qual capacidade para qual uso
Uso previsto16 GB20 GB (RX 7900 XT)24 GB
Chat com um modelo de 8B a 14BSuficienteInútilInútil
Assistente de código 24B, contexto longoCom pouco espaçoConfortávelConfortável
MoE de 26B com contexto médioApertado demaisSuficienteSuficiente
Modelo de 30 a 35B com contexto longoImpossívelApenasNecessário

O princípio: pague pela capacidade que o seu maior modelo exige, não por aquela que talvez você use um dia. Se sua meta é um modelo de 24B com contexto, 20 GB é o primeiro patamar em que isso se torna confortável; acima disso, cada gigabyte adicional deve ser justificado por um modelo específico.

#Configuração inicial

  1. 01
    Escolher o sistema
    A AMD oferece suporte às Radeon RX 7000 apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. No Windows, o Ollama utiliza uma pilha ROCm v7 ou HIP7; o Vulkan serve como alternativa de fallback.
  2. 02
    Instalar o driver e Ollama
    No Linux, o Ollama exige o driver ROCm v7. Instale-o com o utilitário amdgpu-install e, depois, instale o Ollama.
  3. 03
    Carregar um modelo de 24B
    Use um Devstral Small 2 24B em Q4_K_M, inicie-o e verifique com ollama ps se ele usa 100% da GPU.
  4. 04
    Ajustar o contexto
    Aumente a janela de contexto gradualmente, monitorando a VRAM: o objetivo é manter o uso total abaixo de 19 GB.
  5. 05
    Comparar Vulkan e ROCm
    Meça com llama-bench no seu modelo. Os dois backends apresentam desempenho semelhante nessa placa nas medições públicas.
Terminal
ollama ps
rocm-smi --showmeminfo vram
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Veredito 2026

Uma boa escolha
Se você quiser executar modelos de 24 a 26B com espaço para o contexto e o custo por GB de VRAM em /prix-gpu-ia for favorável.
Uma escolha mediana
Se sua prioridade é a velocidade: a geração tem um limite próximo ao de uma placa de 16 GB, e a RTX 4070 Ti Super lê os prompts duas vezes mais rápido.
Uma escolha insuficiente
Para modelos de 30 a 35B com contexto longo, casos em que 24 GB se tornam necessários.

#Perguntas frequentes

FAQ
A RX 7900 XT é boa para LLMs locais?+
Sim, pela memória: 20 GB permitem carregar um modelo de 24B em Q4 com um contexto confortável, algo que 16 GB mal permitem. Sua velocidade de geração, cerca de 123 tokens por segundo em um modelo de 7B em Q4_0 com Vulkan, permanece próxima à de uma RX 7800 XT.
RX 7900 XT ou RX 7900 XTX para IA local?+
A XTX oferece 24 GB e gera 48% mais rápido no modelo 7B de referência sob Vulkan (182,63 contra 123,18 tokens por segundo). A XT é suficiente para modelos de 24 a 26B e custa menos. Compare os preços atuais na página dedicada do site.
20 GB de VRAM são suficientes para um modelo de 30B?+
Um 30B como Granite 4.1 30B pesa aproximadamente 17 GB em Q4: ele cabe com um contexto curto, com cerca de 2 GB de margem. Para um contexto longo ou para modelos de 35B, como Qwen3.6 35B-A3B, 24 GB se tornam necessários. Consulte o guia dedicado a esse modelo.
Quantos tokens por segundo a RX 7900 XT consegue?+
Com Llama 2 7B em Q4_0, as discussões públicas do repositório llama.cpp indicam 123,18 tokens por segundo com Vulkan e 116,15 com ROCm na geração. Para um modelo de 24B em Q4, o cálculo resulta em cerca de 34 tokens por segundo: uma estimativa a medir na sua máquina.
RX 7900 XT ou RTX 4070 Ti Super para um LLM?+
A XT pela capacidade (20 GB contra 16): ela carrega modelos de 24 a 26B com contexto. A RTX 4070 Ti Super gera 5% mais rápido no modelo de referência de 7B e lê os prompts duas vezes mais rápido, com o ecossistema CUDA. A escolha depende do modelo pretendido.
A RX 7900 XT funciona com Ollama no Windows?+
Sim: a documentação do Ollama a lista no Windows, com uma pilha ROCm v7 ou HIP7, e no Linux com o driver ROCm v7. A AMD a lista no ROCm, com o alvo gfx1100, no Ubuntu 24.04.4, 22.04.5, RHEL 10.1 e RHEL 9.7. O Vulkan continua disponível como alternativa.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.