Qual LLM para Radeon RX 7900 GRE (16 GB) ?
A Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) executa modelos com 20 a 24 bilhões de parâmetros em Q4, como a RX 7800 XT, mas não melhora a velocidade de geração: as medições públicas sobre Llama 2 7B dão 116 tokens por segundo contra 118 para a RX 7800 XT sob Vulkan. Seu ponto forte está em outra área, na leitura do prompt sob Vulkan, um pouco mais rápida (2 336 contra 2 017 tokens por segundo).
A 7900 GRE parece uma 7800 XT mais potente em cálculo, mas limitada em memória, e as medições mostram isso. Este guia explica o que seus 16 GB permitem, em que ela difere de suas duas vizinhas diretas, a RX 7800 XT e a RX 9070, e para que uso ela vale o preço.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: Radeon RX 9070 XT 16 GB.
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que a RX 7900 GRE faz em 2026
A RX 7900 GRE carrega em Q4 tudo o que pesa menos de 15 GB: Gemma 4 12B até Q8, gpt-oss 20B e Devstral Small 2 24B com contexto curto. Sua velocidade de geração, limitada por seus 576 GB/s, fica em torno de 116 tokens por segundo no modelo de referência de 7B dos rankings com Vulkan. O ponto principal é este: seu número de processadores de fluxo, 5.120 contra 3.840 da 7800 XT, acelera a leitura dos prompts, mas não a geração, pois ela não tem mais memória nem maior largura de banda que sua vizinha. A AMD a lista oficialmente no ROCm, e o Ollama oferece suporte a ela no Linux e no Windows.
- Arquitetura
- RDNA 3, Navi 31 (o chip da RX 7900 XTX, aqui em uma versão reduzida), 80 unidades de computação e 5.120 processadores de fluxo.
- Memória
- 16 GB GDDR6 com um barramento de 256 bits, ou seja, 576 GB/s.
- Consumo
- 260 W de potência da placa.
- Disponibilidade
- Inicialmente restrita à China (27 de julho de 2023), comercializada internacionalmente em 27 de fevereiro de 2024, com preço de lançamento de 549 dólares.
- Preço atual
- Consulte /prix-gpu-ia: o preço muda toda semana.
#7900 GRE contra 7800 XT: a memória decide
As duas placas oferecem 16 GB. A 7800 XT tem 624 GB/s de largura de banda, a 7900 GRE tem 576 GB/s, ou seja, 8% a menos. Na geração, em que cada token relê todos os pesos, a largura de banda é determinante: a 7800 XT supera ligeiramente a GRE na discussão sobre Vulkan do llama.cpp, e de forma mais clara com a Flash Attention ativada. A GRE recupera a vantagem no processamento do prompt com Vulkan (16% a mais), em que o cálculo tem mais peso. Com ROCm, as duas séries públicas mostram a 7800 XT à frente nas duas medições.
| Medição | RX 7900 GRE | RX 7800 XT |
|---|---|---|
| Vulkan, leitura pp512, sem FA | 2 336,31 t/s | 2 017,33 t/s |
| Vulkan, geração tg128, sem FA | 116,11 t/s | 118,27 t/s |
| Vulkan, geração tg128, com FA | 110,50 t/s | 124,86 t/s |
| ROCm, leitura pp512, sem FA | 1 456,98 t/s | 2 151,81 t/s |
| ROCm, geração tg128, sem FA | 96,07 t/s | 100,94 t/s |
Essas séries vêm de contribuidores diferentes, com commits de llama.cpp distintos: a diferença indica uma ordem de grandeza, não uma comparação de laboratório. Ainda assim, elas concordam que a GRE não gera mais rápido que uma 7800 XT. Se você encontrar as duas pelo mesmo preço, escolha a 7800 XT para conversação e a GRE para uso com prompts longos.
#O que cabe em 16 GB de VRAM
Conte com cerca de 15 GB para o modelo e seu cache KV quando a placa não estiver sendo usada para exibir a imagem na tela. Os pesos em Q4 vêm do catálogo QuelLLM; o consumo de memória do contexto se soma ao dos pesos.
| Modelo | Tamanho do modelo | Margem para o contexto | Veredito |
|---|---|---|---|
| Gemma 4 12B em Q4 | ≈ 7 GB | ≈ 8 GB | Muito confortável, contexto longo |
| Gemma 4 12B em Q8 | ≈ 13 GB | ≈ 2 GB | Cabe, contexto curto |
| gpt-oss 20B em Q4 | ≈ 13 GB | ≈ 2 GB | Cabe, com contexto curto a médio |
| Devstral Small 2 24B em Q4 | ≈ 14 GB | ≈ 1 GB | Cabe, mas com pouca folga |
| Gemma 4 31B em Q4 | ≈ 18 GB | nenhuma | Não cabe na memória; são necessários de 20 a 24 GB |
O limite dos 16 GB fica, portanto, entre o 24B, que cabe, e o 31B, que não cabe. Para ultrapassar esse limite sem passar para uma placa de 24 GB, a RX 7900 XT com 20 GB oferece uma margem intermediária; o guia dedicado detalha o que ela oferece. Para todas as placas de 16 GB, independentemente da marca, a página por VRAM compara os modelos.
- Radeon RX 7900 XT : 20 GB para ultrapassar o 24B
- Qual LLM para 16 GB de VRAM, independentemente da placa
#Taxas medidas e limite de largura de banda
Nenhum número desta página resulta de uma medição feita pelo site. Os valores vêm das discussões públicas do repositório llama.cpp, que usam todas o Llama 2 7B em Q4_0 (3,56 GiB) e o llama-bench. A leitura do prompt (pp512) mede a velocidade de ingestão de 512 tokens; a geração (tg128) mede a velocidade de escrita. Para a RX 7900 GRE com Vulkan, a discussão informa 116,11 tokens por segundo na geração sem Flash Attention e 110,50 com. Com ROCm, informa 96,07.
O limite teórico da geração, calculado dividindo a largura de banda pelo tamanho dos pesos, corresponde aqui a 576 GB/s divididos por 3,82 GB, ou seja, cerca de 151 tokens por segundo. A placa atinge 77% desse limite com Vulkan sem Flash Attention. Aplicar esse rendimento a modelos maiores dá uma ordem de grandeza: não é uma medição, e outro driver ou outra versão do llama.cpp fará esse valor mudar.
| Modelo (Q4) | Tamanho do modelo | Limite teórica | Ordem de grandeza |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 96 tokens/s | ≈ 72 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 82 tokens/s | ≈ 62 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 64 tokens/s | ≈ 48 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 41 tokens/s | ≈ 31 tokens/s |
#O que a leitura do prompt muda na prática
A leitura do prompt parece abstrata enquanto não a convertemos em segundos de espera. O cálculo é simples: número de tokens do prompt dividido pela velocidade pp512. Ele pressupõe que a velocidade medida com 512 tokens se mantém em um prompt mais longo, o que é apenas aproximadamente verdadeiro, pois a leitura fica mais lenta quando o contexto aumenta. Os tempos abaixo são, portanto, ordens de grandeza para um documento de cerca de 4.000 tokens, ou seja, aproximadamente dez páginas.
| Placa e backend | Velocidade pp512 | Tempo de espera até a primeira palavra |
|---|---|---|
| RX 7900 GRE, Vulkan | 2 336 t/s | ≈ 1,7 s |
| RX 7800 XT, Vulkan | 2 017 t/s | ≈ 2,0 s |
| RX 7900 GRE, ROCm | 1 457 t/s | ≈ 2,7 s |
| RX 9070, Vulkan | 3 164 t/s | ≈ 1,3 s |
A diferença entre essas placas é medida em frações de segundo em um documento curto. Torna-se perceptível quando o prompt atinge dezenas de milhares de tokens, como em um repositório de código completo ou um lote de PDFs, ou quando cada requisição de um agente relê grandes contextos. Para uso de baixo volume, escolha a placa com base no custo por GB de VRAM, e não nesse critério.
#Diante da RX 9070: mesma VRAM, RDNA 4
A RX 9070 é a outra placa de 16 GB da gama atual. Ela tem 640 GB/s de largura de banda contra 576 GB/s, um TDP de 220 W contra 260 W e 3.584 processadores de fluxo. Sob Vulkan, ela gera 119,71 tokens por segundo e lê 3.164: mais rápida na leitura do prompt em 35%, quase igual na geração. A diferença prática está em outro lugar: ROCm, Ollama e Windows comportam-se de forma diferente entre essas duas gerações, o que é detalhado na página da RX 9070. Um exemplo concreto: a documentação de Ollama lista a RX 9070 entre as placas ROCm sob Linux, mas não sob Windows, onde ela passa por Vulkan, enquanto a RX 7900 GRE aparece nas listas dos dois sistemas. Se você trabalha sob Windows e deseja usar ROCm, a GRE é vantajosa; se aceita Vulkan, a diferença desaparece.
| Critério | RX 7900 GRE | RX 9070 |
|---|---|---|
| Largura de banda | 576 GB/s | 640 GB/s |
| Potência da placa | 260 W | 220 W |
| Leitura pp512 | 2 336,31 t/s | 3 164,10 t/s |
| Geração tg128 | 116,11 t/s | 119,71 t/s |
#Configuração inicial
- 01Escolher o sistemaA AMD oferece suporte às Radeon RX 7000 somente no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. No Windows, o Ollama utiliza uma pilha ROCm v7 ou HIP7.
- 02Instalar OllamaO driver ROCm v7 é necessário no Linux. Vulkan, ativado por padrão, serve como alternativa de reserva e dá bons resultados nessa placa.
- 03Carregar um modelo que cabeTeste primeiro um 12B ou um 20B, depois um 24B, com um contexto curto. Verifique com ollama ps se o modelo está totalmente na GPU.
- 04Comparar os dois backendsExecute o llama-bench com Vulkan e depois com ROCm, com e sem Flash Attention. Nessa placa, a Flash Attention tornou a geração mais lenta com Vulkan nas medições públicas.
#Para que uso escolher a 7900 GRE
O critério que a diferencia é a relação entre capacidade de processamento e memória: muita capacidade de processamento para 16 GB e 576 GB/s. Ela é adequada quando o tempo até a primeira palavra importa tanto quanto a velocidade de escrita, por exemplo, para um assistente que processa documentos longos ou um fluxo RAG cujo prompt contém milhares de tokens. Para um chat curto, a vantagem desaparece e a 7800 XT, com mais largura de banda, tem um desempenho igual ou melhor.
| Uso | Placa recomendada | Motivo |
|---|---|---|
| Chat, geração de texto | RX 7800 XT ou RX 9070 | Banda passante maior, geração mais rápida ou igual |
| RAG, documentos longos | RX 9070, depois RX 7900 GRE | Leitura do prompt mais rápida |
| Modelos de 30 a 32B | Nenhuma das três | Precisa de 20 a 24 GB de VRAM |
| Orçamento apertado para comprar uma placa usada | A mais barata das três | O custo por GB de VRAM em /prix-gpu-ia é decisivo |
Resumindo para as três placas de 16 GB: a 7800 XT é a escolha simples para conversas, a 9070 é a escolha mais rápida em leitura e a mais econômica em energia, com 220 W, e a 7900 GRE é a escolha oportunista quando seu preço fica abaixo do preço das outras duas. Nenhuma delas permite rodar modelos de 30 bilhões de parâmetros, que exigem mais memória.
#Veredito 2026
- Uma escolha adequada
- Se você encontrar a GRE pelo preço de uma 7800 XT ou menos e seus prompts forem longos.
- Uma escolha menos adequada
- Se ela custar mais que uma 7800 XT e você a usar principalmente para conversar: você estará pagando por capacidade de cálculo que a geração não utiliza.
- Verificar antes da compra
- Que o sistema detecte corretamente os 16 GB de VRAM e o modelo correto da placa, usando rocminfo no Linux ou o Gerenciador de Tarefas no Windows.
- Preços das placas de vídeo para IA local, registrados duas vezes por semana
- Documentação Ollama: placas AMD suportadas
- Compatibilidade de GPU do ROCm, documentação da AMD
- Placar Vulkan do repositório llama.cpp
#Perguntas frequentes
A RX 7900 GRE é boa para LLMs locais?+
RX 7900 GRE ou RX 7800 XT para IA local?+
Quais modelos rodar em uma RX 7900 GRE de 16 GB?+
A RX 7900 GRE funciona com o Ollama?+
Vulkan ou ROCm na RX 7900 GRE?+
Quando a RX 7900 GRE deixa de ser suficiente?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.