Qual LLM na Radeon RX 7800 XT (16 GB) ?
A Radeon RX 7800 XT é uma boa opção para IA local, sobretudo pelos 16 GB de VRAM e pela largura de banda de 624 GB/s: ela carrega modelos de 20 a 24 bilhões de parâmetros em Q4, algo que placas de 12 GB não conseguem fazer. Uma medição pública com Llama 2 7B em Q4_0 registra 118 tokens por segundo na geração com Vulkan. Mais importante que o preço da placa é o custo por GB de VRAM, que você pode comparar em /prix-gpu-ia.
Uma boa oferta de placa de vídeo se avalia pelo fato de o modelo desejado caber nela, não pelo preço anunciado. A RX 7800 XT é uma das poucas placas de 16 GB da geração RDNA 3 com suporte oficial no ROCm e no Ollama. Este guia mostra o que ela executa, a que velocidade segundo medições publicadas e como avaliar uma oferta sem depender de um preço que muda a cada semana.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: Radeon RX 9070 XT 16 GB.
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que a RX 7800 XT é um bom negócio para um LLM local
A RX 7800 XT reúne três vantagens raras nessa faixa de mercado. Seus 16 GB de GDDR6 em um barramento de 256 bits oferecem 624 GB/s de largura de banda, o fator que limita a velocidade de geração de um LLM. A AMD a lista oficialmente no ROCm (RDNA 3, alvo gfx1101), e o Ollama a cita tanto para Linux quanto para Windows. Por fim, as medições públicas situam seu desempenho em 118,27 tokens por segundo na geração com um modelo de 7B em Q4_0 usando Vulkan, superando uma RX 7900 GRE na mesma série de medições. Seu ponto fraco em relação à NVIDIA não é a velocidade de geração, mas a leitura do prompt, três vezes mais lenta que a de uma RTX 4070 Ti Super.
- Arquitetura
- RDNA 3, Navi 32 em chiplets: um GCD e quatro MCD, lançada em 6 de setembro de 2023. Portanto, ela não é monolítica.
- Cálculo
- 3.840 processadores de fluxo, 60 unidades de cálculo.
- Memória
- 16 GB GDDR6, barramento de 256 bits, 624 GB/s.
- Consumo
- 263 W de potência da placa.
- Preço
- Não é fixado aqui: veja /prix-gpu-ia, que registra o menor preço todas as segundas e quintas-feiras.
#Avaliar uma oferta sem preço fixo
A expressão 'bom negócio' implica um preço, e o preço de uma placa muda de uma semana para outra. Em vez de citar um valor que estaria incorreto daqui a dez dias, veja o método. Calcule o custo por GB de VRAM: o preço dividido por 16 para a 7800 XT, por 12 para uma placa de 12 GB. O monitoramento do site publica esse valor para cada placa. Depois, faça a si mesmo a única pergunta que importa: a capacidade adicional permite usar um modelo que você realmente quer usar? Passar de 12 para 16 GB permite usar modelos de 20 a 24B; passar de 16 para 24 GB permite usar modelos de 30B ou mais.
| Situação | Cálculo a ser feito | Conclusão |
|---|---|---|
| Oferta de uma 7800 XT | Preço ÷ 16 GB | Compare com o custo por GB das placas de 12 GB e 24 GB em /prix-gpu-ia. |
| Diferença de preço com uma placa de 12 GB | Diferença dividida por 4 GB adicionais | Abaixo do custo médio por GB, a placa de 16 GB é um bom negócio |
| Diferença em relação a uma RTX de 16 GB | Quanto o CUDA vale para você | Pague por isso somente se uma ferramenta exigir ou se a leitura do prompt for importante. |
| Placa usada | Testar com um modelo de 12 a 14 GB antes da compra | Recuse se não houver um teste real de carregamento |
Um exemplo de raciocínio, sem indicar preços: se a diferença entre uma placa de 12 GB e a 7800 XT equivale a um valor que você teria gasto de qualquer forma para usar um modelo de 24B, a questão está resolvida. Por outro lado, se você usa apenas modelos de 8 a 12B, esses 4 GB não têm utilidade, e a RX 7700 XT ou a RX 6700 XT são suficientes.
- Preços das placas de vídeo para IA local, registrados duas vezes por semana
- Qual LLM para 16 GB de VRAM, independentemente da placa
#O que cabe em 16 GB de VRAM
Com 16 GB, conte com cerca de 15 GB para o modelo e seu cache KV quando a placa não estiver responsável pela saída de vídeo. O catálogo QuelLLM apresenta abaixo os pesos em Q4; o contexto ocupa memória adicional, e a margem rapidamente se torna o fator limitante nos modelos grandes.
| Modelo | Tamanho do modelo | Margem para o contexto | Veredito |
|---|---|---|---|
| Gemma 4 12B em Q8 | ≈ 13 GB | ≈ 2 GB | Cabe, contexto curto |
| gpt-oss 20B em Q4 | ≈ 13 GB | ≈ 2 GB | Cabe, com contexto curto a médio |
| Devstral Small 2 24B em Q4 | ≈ 14 GB | ≈ 1 GB | Fica apertado, contexto muito curto |
| Gemma 4 26B-A4B em Q4 | ≈ 16 GB | nenhuma | Apertado demais |
| Granite 4.1 30B em Q4 | ≈ 17 GB | nenhuma | Não cabe |
A palavra-chave da tabela é a margem: um 24B em Q4 cabe, mas com um contexto de apenas alguns milhares de tokens. Para tarefas de programação com arquivos longos, a quantização do cache KV libera de um a dois gigabytes, e uma placa de 20 GB como a RX 7900 XT resolve o problema. A tabela do site sobre modelos para 16 GB, independentemente da marca da placa, detalha os compromissos da quantização.
Um comentário sobre modelos com especialistas (MoE) como gpt-oss 20B: apenas uma parte dos parâmetros é usada em cada token, o que acelera a geração, mas todos os pesos devem permanecer na memória. É o tamanho total, e não o ativo, que decide se o modelo cabe nos 16 GB. Isso explica por que um MoE de 20B está ao lado de um denso de 12B na tabela acima, com o mesmo peso de aproximadamente 13 GB.
#Taxas medidas: Vulkan ou ROCm
Os números abaixo não são medições feitas pelo site: vêm de duas discussões públicas do repositório llama.cpp, uma sobre Vulkan e outra sobre ROCm, ambas testando Llama 2 7B em Q4_0 com llama-bench. Os commits do llama.cpp, os sistemas e os drivers diferem entre as séries, portanto a diferença entre elas é uma indicação, não uma classificação definitiva.
| Backend | Flash Attention | Leitura pp512 | Geração tg128 |
|---|---|---|---|
| Vulkan | não | 2 017,33 t/s | 118,27 t/s |
| Vulkan | sim | 2 197,05 t/s | 124,86 t/s |
| ROCm | não | 2 151,81 t/s | 100,94 t/s |
| ROCm | sim | 2 304,63 t/s | 95,99 t/s |
Dois aprendizados se destacam. Primeiro, nessas séries, Vulkan gera mais rápido que ROCm nessa placa (118 contra 101 tokens por segundo sem Flash Attention), enquanto ROCm lê um pouco mais rápido o prompt. Em seguida, a Flash Attention acelera Vulkan, mas diminui levemente a geração sob ROCm. Se a sua prioridade for a velocidade de resposta em conversa, experimente os dois backends com o seu modelo, em vez de assumir que ROCm vence.
O rendimento em relação ao limite teórico ajuda a evitar preocupações: 624 GB/s divididos por 3,82 GB de pesos dão 163 tokens por segundo; a placa atinge 72% desse limite com Vulkan. Aplicada a modelos maiores, essa proporção fornece ordens de grandeza, a confirmar no seu equipamento.
| Modelo (Q4) | Tamanho do modelo | Limite teórica | Ordem de grandeza |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 104 tokens/s | ≈ 75 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 89 tokens/s | ≈ 64 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 69 tokens/s | ≈ 50 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 45 tokens/s | ≈ 32 tokens/s |
#Comparação com as placas NVIDIA de 16 GB: a leitura do prompt faz a diferença
A comparação com as RTX de 16 GB envolve duas medidas. Na geração, a RX 7800 XT permanece na mesma faixa que as placas NVIDIA medidas com Vulkan. No processamento do prompt, a diferença é muito grande: um terço da velocidade de uma RTX 4070 Ti Super. Esse segundo número tem peso nos usos com documentos longos ou históricos de conversa longos, em que se espera pela primeira palavra. Para um chat curto ou um assistente de código com contexto modesto, ele tem pouco peso.
| Placa | VRAM | Leitura pp512 | Geração tg128 |
|---|---|---|---|
| RX 7800 XT | 16 GB | 2 017,33 t/s | 118,27 t/s |
| RTX 4070 Ti Super | 16 GB | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 16 GB | 6 213,63 t/s | 135,63 t/s |
- RTX 4070 Ti Super, a alternativa NVIDIA com 16 GB
- Radeon RX 7900 GRE, outra placa de 16 GB da mesma geração
#Fazer um 24B caber em 16 GB: os ajustes úteis
Um modelo com 24 bilhões de parâmetros em Q4 pesa cerca de 14 GB, o que deixa mal um gigabyte para o cache KV e o sistema. Quatro medidas evitam que parte do processamento seja transferida para a CPU, o que faria a velocidade cair. A primeira é limitar a janela de contexto ao que você realmente precisa, pois o cache cresce a cada token. A segunda é quantizar o cache KV, o que libera de um a dois gigabytes. A terceira é fechar aplicativos que reservam VRAM, como um navegador com aceleração de hardware ou um jogo. A quarta é conectar o monitor à GPU integrada do processador, quando ela existir, o que devolve à placa AMD a memória que a exibição ocupava.
- Contexto
- Defina a janela conforme a necessidade real: 4.000 a 8.000 tokens são suficientes para a maioria das conversas.
- Cache KV
- Quantize-o em 8 bits para liberar VRAM, monitorando a qualidade nas suas tarefas.
- Exibição
- Use a saída de vídeo da placa integrada quando existir.
- Verificação
- Após o carregamento, ollama ps deve exibir 100 % GPU; qualquer outra proporção indica que parte do modelo passou para a RAM do sistema.
O guia sobre a janela de contexto explica por que um histórico longo consome tanta memória quanto o próprio modelo em placas pequenas.
#Configuração inicial
- 01Escolher o sistemaNo Linux, a AMD oferece suporte às Radeon RX 7000 apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. No Windows, o Ollama utiliza uma pilha ROCm v7 ou HIP7.
- 02Instalar OllamaSiga a documentação do Ollama: o driver ROCm v7 é obrigatório no Linux. O Vulkan está ativado por padrão e serve como alternativa de fallback.
- 03Carregar um modelo que cabeEscolha um 12B em Q8 ou um 20B em Q4 antes de experimentar um 24B. Verifique com ollama ps se ele está inteiramente na GPU.
- 04Comparar Vulkan e ROCmInicie o llama-bench com os dois backends no seu modelo, com e sem Flash Attention, e mantenha o mais rápido para o seu uso.
#Veredito 2026
- Uma boa opção se
- Se você busca modelos de 20 a 24B e o preço por GB de VRAM em /prix-gpu-ia é inferior ao das placas próximas com 12 GB.
- Não é uma boa ideia se
- Você continua com modelos de 8 a 12B: uma placa de 12 GB é suficiente, e você paga por gigabytes que não utiliza.
- Evitar
- Comprar sem teste de carregamento de um modelo de 12 a 14 GB quando a placa for de segunda mão.
- Documentação Ollama: placas AMD suportadas
- Compatibilidade de GPU do ROCm, documentação da AMD
- Placar Vulkan do repositório llama.cpp
- Placar ROCm do repositório llama.cpp
#Perguntas frequentes
RX 7800 XT: é um bom negócio para rodar LLMs?+
A RX 7800 XT é boa para LLMs em 2026?+
Vulkan ou ROCm no RX 7800 XT?+
RX 7800 XT ou RX 7700 XT para IA local?+
Quais modelos cabem em uma RX 7800 XT de 16 GB?+
A RX 7800 XT é suportada pelo Ollama?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.