Intermediário 11 minRadeon RX 7000

Qual LLM para Radeon RX 7900 GRE (16 GB) ?

Resposta direta

A Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) executa modelos com 20 a 24 bilhões de parâmetros em Q4, como a RX 7800 XT, mas não melhora a velocidade de geração: as medições públicas sobre Llama 2 7B dão 116 tokens por segundo contra 118 para a RX 7800 XT sob Vulkan. Seu ponto forte está em outra área, na leitura do prompt sob Vulkan, um pouco mais rápida (2 336 contra 2 017 tokens por segundo).

A 7900 GRE parece uma 7800 XT mais potente em cálculo, mas limitada em memória, e as medições mostram isso. Este guia explica o que seus 16 GB permitem, em que ela difere de suas duas vizinhas diretas, a RX 7800 XT e a RX 9070, e para que uso ela vale o preço.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: Radeon RX 9070 XT 16 GB.

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que a RX 7900 GRE faz em 2026

A RX 7900 GRE carrega em Q4 tudo o que pesa menos de 15 GB: Gemma 4 12B até Q8, gpt-oss 20B e Devstral Small 2 24B com contexto curto. Sua velocidade de geração, limitada por seus 576 GB/s, fica em torno de 116 tokens por segundo no modelo de referência de 7B dos rankings com Vulkan. O ponto principal é este: seu número de processadores de fluxo, 5.120 contra 3.840 da 7800 XT, acelera a leitura dos prompts, mas não a geração, pois ela não tem mais memória nem maior largura de banda que sua vizinha. A AMD a lista oficialmente no ROCm, e o Ollama oferece suporte a ela no Linux e no Windows.

Arquitetura
RDNA 3, Navi 31 (o chip da RX 7900 XTX, aqui em uma versão reduzida), 80 unidades de computação e 5.120 processadores de fluxo.
Memória
16 GB GDDR6 com um barramento de 256 bits, ou seja, 576 GB/s.
Consumo
260 W de potência da placa.
Disponibilidade
Inicialmente restrita à China (27 de julho de 2023), comercializada internacionalmente em 27 de fevereiro de 2024, com preço de lançamento de 549 dólares.
Preço atual
Consulte /prix-gpu-ia: o preço muda toda semana.

#7900 GRE contra 7800 XT: a memória decide

As duas placas oferecem 16 GB. A 7800 XT tem 624 GB/s de largura de banda, a 7900 GRE tem 576 GB/s, ou seja, 8% a menos. Na geração, em que cada token relê todos os pesos, a largura de banda é determinante: a 7800 XT supera ligeiramente a GRE na discussão sobre Vulkan do llama.cpp, e de forma mais clara com a Flash Attention ativada. A GRE recupera a vantagem no processamento do prompt com Vulkan (16% a mais), em que o cálculo tem mais peso. Com ROCm, as duas séries públicas mostram a 7800 XT à frente nas duas medições.

RX 7900 GRE e RX 7800 XT (Llama 2 7B Q4_0, medições públicas do llama.cpp)
MediçãoRX 7900 GRERX 7800 XT
Vulkan, leitura pp512, sem FA2 336,31 t/s2 017,33 t/s
Vulkan, geração tg128, sem FA116,11 t/s118,27 t/s
Vulkan, geração tg128, com FA110,50 t/s124,86 t/s
ROCm, leitura pp512, sem FA1 456,98 t/s2 151,81 t/s
ROCm, geração tg128, sem FA96,07 t/s100,94 t/s

Essas séries vêm de contribuidores diferentes, com commits de llama.cpp distintos: a diferença indica uma ordem de grandeza, não uma comparação de laboratório. Ainda assim, elas concordam que a GRE não gera mais rápido que uma 7800 XT. Se você encontrar as duas pelo mesmo preço, escolha a 7800 XT para conversação e a GRE para uso com prompts longos.

#O que cabe em 16 GB de VRAM

Conte com cerca de 15 GB para o modelo e seu cache KV quando a placa não estiver sendo usada para exibir a imagem na tela. Os pesos em Q4 vêm do catálogo QuelLLM; o consumo de memória do contexto se soma ao dos pesos.

O que uma 7900 GRE suporta (apenas os pesos)
ModeloTamanho do modeloMargem para o contextoVeredito
Gemma 4 12B em Q4≈ 7 GB≈ 8 GBMuito confortável, contexto longo
Gemma 4 12B em Q8≈ 13 GB≈ 2 GBCabe, contexto curto
gpt-oss 20B em Q4≈ 13 GB≈ 2 GBCabe, com contexto curto a médio
Devstral Small 2 24B em Q4≈ 14 GB≈ 1 GBCabe, mas com pouca folga
Gemma 4 31B em Q4≈ 18 GBnenhumaNão cabe na memória; são necessários de 20 a 24 GB

O limite dos 16 GB fica, portanto, entre o 24B, que cabe, e o 31B, que não cabe. Para ultrapassar esse limite sem passar para uma placa de 24 GB, a RX 7900 XT com 20 GB oferece uma margem intermediária; o guia dedicado detalha o que ela oferece. Para todas as placas de 16 GB, independentemente da marca, a página por VRAM compara os modelos.

#Taxas medidas e limite de largura de banda

Nenhum número desta página resulta de uma medição feita pelo site. Os valores vêm das discussões públicas do repositório llama.cpp, que usam todas o Llama 2 7B em Q4_0 (3,56 GiB) e o llama-bench. A leitura do prompt (pp512) mede a velocidade de ingestão de 512 tokens; a geração (tg128) mede a velocidade de escrita. Para a RX 7900 GRE com Vulkan, a discussão informa 116,11 tokens por segundo na geração sem Flash Attention e 110,50 com. Com ROCm, informa 96,07.

O limite teórico da geração, calculado dividindo a largura de banda pelo tamanho dos pesos, corresponde aqui a 576 GB/s divididos por 3,82 GB, ou seja, cerca de 151 tokens por segundo. A placa atinge 77% desse limite com Vulkan sem Flash Attention. Aplicar esse rendimento a modelos maiores dá uma ordem de grandeza: não é uma medição, e outro driver ou outra versão do llama.cpp fará esse valor mudar.

Estimativa a 75% do limite de 576 GB/s (cálculo, não medição)
Modelo (Q4)Tamanho do modeloLimite teóricaOrdem de grandeza
Llama 3.1 8B≈ 6 GB≈ 96 tokens/s≈ 72 tokens/s
Gemma 4 12B≈ 7 GB≈ 82 tokens/s≈ 62 tokens/s
Phi-4 14B≈ 9 GB≈ 64 tokens/s≈ 48 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 41 tokens/s≈ 31 tokens/s

#O que a leitura do prompt muda na prática

A leitura do prompt parece abstrata enquanto não a convertemos em segundos de espera. O cálculo é simples: número de tokens do prompt dividido pela velocidade pp512. Ele pressupõe que a velocidade medida com 512 tokens se mantém em um prompt mais longo, o que é apenas aproximadamente verdadeiro, pois a leitura fica mais lenta quando o contexto aumenta. Os tempos abaixo são, portanto, ordens de grandeza para um documento de cerca de 4.000 tokens, ou seja, aproximadamente dez páginas.

Tempo de ingestão de um prompt de 4.000 tokens (cálculo a partir das medições pp512)
Placa e backendVelocidade pp512Tempo de espera até a primeira palavra
RX 7900 GRE, Vulkan2 336 t/s≈ 1,7 s
RX 7800 XT, Vulkan2 017 t/s≈ 2,0 s
RX 7900 GRE, ROCm1 457 t/s≈ 2,7 s
RX 9070, Vulkan3 164 t/s≈ 1,3 s

A diferença entre essas placas é medida em frações de segundo em um documento curto. Torna-se perceptível quando o prompt atinge dezenas de milhares de tokens, como em um repositório de código completo ou um lote de PDFs, ou quando cada requisição de um agente relê grandes contextos. Para uso de baixo volume, escolha a placa com base no custo por GB de VRAM, e não nesse critério.

#Diante da RX 9070: mesma VRAM, RDNA 4

A RX 9070 é a outra placa de 16 GB da gama atual. Ela tem 640 GB/s de largura de banda contra 576 GB/s, um TDP de 220 W contra 260 W e 3.584 processadores de fluxo. Sob Vulkan, ela gera 119,71 tokens por segundo e lê 3.164: mais rápida na leitura do prompt em 35%, quase igual na geração. A diferença prática está em outro lugar: ROCm, Ollama e Windows comportam-se de forma diferente entre essas duas gerações, o que é detalhado na página da RX 9070. Um exemplo concreto: a documentação de Ollama lista a RX 9070 entre as placas ROCm sob Linux, mas não sob Windows, onde ela passa por Vulkan, enquanto a RX 7900 GRE aparece nas listas dos dois sistemas. Se você trabalha sob Windows e deseja usar ROCm, a GRE é vantajosa; se aceita Vulkan, a diferença desaparece.

RX 7900 GRE e RX 9070 com Vulkan (Llama 2 7B Q4_0, sem FA)
CritérioRX 7900 GRERX 9070
Largura de banda576 GB/s640 GB/s
Potência da placa260 W220 W
Leitura pp5122 336,31 t/s3 164,10 t/s
Geração tg128116,11 t/s119,71 t/s

#Configuração inicial

  1. 01
    Escolher o sistema
    A AMD oferece suporte às Radeon RX 7000 somente no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. No Windows, o Ollama utiliza uma pilha ROCm v7 ou HIP7.
  2. 02
    Instalar Ollama
    O driver ROCm v7 é necessário no Linux. Vulkan, ativado por padrão, serve como alternativa de reserva e dá bons resultados nessa placa.
  3. 03
    Carregar um modelo que cabe
    Teste primeiro um 12B ou um 20B, depois um 24B, com um contexto curto. Verifique com ollama ps se o modelo está totalmente na GPU.
  4. 04
    Comparar os dois backends
    Execute o llama-bench com Vulkan e depois com ROCm, com e sem Flash Attention. Nessa placa, a Flash Attention tornou a geração mais lenta com Vulkan nas medições públicas.
Terminal
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Para que uso escolher a 7900 GRE

O critério que a diferencia é a relação entre capacidade de processamento e memória: muita capacidade de processamento para 16 GB e 576 GB/s. Ela é adequada quando o tempo até a primeira palavra importa tanto quanto a velocidade de escrita, por exemplo, para um assistente que processa documentos longos ou um fluxo RAG cujo prompt contém milhares de tokens. Para um chat curto, a vantagem desaparece e a 7800 XT, com mais largura de banda, tem um desempenho igual ou melhor.

Qual placa AMD de 16 GB para cada uso
UsoPlaca recomendadaMotivo
Chat, geração de textoRX 7800 XT ou RX 9070Banda passante maior, geração mais rápida ou igual
RAG, documentos longosRX 9070, depois RX 7900 GRELeitura do prompt mais rápida
Modelos de 30 a 32BNenhuma das trêsPrecisa de 20 a 24 GB de VRAM
Orçamento apertado para comprar uma placa usadaA mais barata das trêsO custo por GB de VRAM em /prix-gpu-ia é decisivo

Resumindo para as três placas de 16 GB: a 7800 XT é a escolha simples para conversas, a 9070 é a escolha mais rápida em leitura e a mais econômica em energia, com 220 W, e a 7900 GRE é a escolha oportunista quando seu preço fica abaixo do preço das outras duas. Nenhuma delas permite rodar modelos de 30 bilhões de parâmetros, que exigem mais memória.

#Veredito 2026

Uma escolha adequada
Se você encontrar a GRE pelo preço de uma 7800 XT ou menos e seus prompts forem longos.
Uma escolha menos adequada
Se ela custar mais que uma 7800 XT e você a usar principalmente para conversar: você estará pagando por capacidade de cálculo que a geração não utiliza.
Verificar antes da compra
Que o sistema detecte corretamente os 16 GB de VRAM e o modelo correto da placa, usando rocminfo no Linux ou o Gerenciador de Tarefas no Windows.

#Perguntas frequentes

FAQ
A RX 7900 GRE é boa para LLMs locais?+
Sim: seus 16 GB permitem carregar modelos de 20 a 24 bilhões de parâmetros em Q4, e ela gera cerca de 116 tokens por segundo em um modelo de 7B em Q4_0 usando Vulkan, segundo uma medição pública. Sua vantagem em relação à RX 7800 XT se limita à leitura do prompt.
RX 7900 GRE ou RX 7800 XT para IA local?+
A 7800 XT para conversas: tem 624 GB/s de largura de banda contra 576 GB/s e gera um pouco mais rápido nos testes públicos. A 7900 GRE lê o prompt cerca de 16% mais rápido com Vulkan, útil para documentos longos. A preço igual, a escolha depende desse uso.
Quais modelos rodar em uma RX 7900 GRE de 16 GB?+
Gemma 4 12B em Q4 ou Q8, gpt-oss 20B em Q4 e Devstral Small 2 24B em Q4 cabem na memória, com contexto curto para os dois últimos. Um modelo de 31B como Gemma 4 em Q4, cerca de 18 GB, ultrapassa os 16 GB da placa.
A RX 7900 GRE funciona com o Ollama?+
Sim, a documentação do Ollama lista essa placa no Linux, com o driver ROCm v7, e no Windows. A AMD também a lista no ROCm, com o alvo gfx1100, mas apenas no Ubuntu 24.04.4, 22.04.5, RHEL 10.1 e RHEL 9.7. O Vulkan, ativado por padrão no Ollama, continua utilizável como alternativa se a detecção falhar.
Vulkan ou ROCm na RX 7900 GRE?+
Nas discussões públicas do repositório llama.cpp, Vulkan gera mais rápido que ROCm nessa placa (116 contra 96 tokens por segundo sem Flash Attention) e também lê o prompt mais rápido. As configurações variam de uma série de testes para outra: teste os dois com seu modelo.
Quando a RX 7900 GRE deixa de ser suficiente?+
Assim que você busca modelos com 30 bilhões de parâmetros ou mais, ou um contexto muito longo em um 24B: 16 GB já não são suficientes. A RX 7900 XT com 20 GB ou uma placa de 24 GB são as próximas opções.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.