Intermediário 11 minRadeon RX 7000

Qual LLM na Radeon RX 7800 XT (16 GB) ?

Resposta direta

A Radeon RX 7800 XT é uma boa opção para IA local, sobretudo pelos 16 GB de VRAM e pela largura de banda de 624 GB/s: ela carrega modelos de 20 a 24 bilhões de parâmetros em Q4, algo que placas de 12 GB não conseguem fazer. Uma medição pública com Llama 2 7B em Q4_0 registra 118 tokens por segundo na geração com Vulkan. Mais importante que o preço da placa é o custo por GB de VRAM, que você pode comparar em /prix-gpu-ia.

Uma boa oferta de placa de vídeo se avalia pelo fato de o modelo desejado caber nela, não pelo preço anunciado. A RX 7800 XT é uma das poucas placas de 16 GB da geração RDNA 3 com suporte oficial no ROCm e no Ollama. Este guia mostra o que ela executa, a que velocidade segundo medições publicadas e como avaliar uma oferta sem depender de um preço que muda a cada semana.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: Radeon RX 9070 XT 16 GB.

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Por que a RX 7800 XT é um bom negócio para um LLM local

A RX 7800 XT reúne três vantagens raras nessa faixa de mercado. Seus 16 GB de GDDR6 em um barramento de 256 bits oferecem 624 GB/s de largura de banda, o fator que limita a velocidade de geração de um LLM. A AMD a lista oficialmente no ROCm (RDNA 3, alvo gfx1101), e o Ollama a cita tanto para Linux quanto para Windows. Por fim, as medições públicas situam seu desempenho em 118,27 tokens por segundo na geração com um modelo de 7B em Q4_0 usando Vulkan, superando uma RX 7900 GRE na mesma série de medições. Seu ponto fraco em relação à NVIDIA não é a velocidade de geração, mas a leitura do prompt, três vezes mais lenta que a de uma RTX 4070 Ti Super.

Arquitetura
RDNA 3, Navi 32 em chiplets: um GCD e quatro MCD, lançada em 6 de setembro de 2023. Portanto, ela não é monolítica.
Cálculo
3.840 processadores de fluxo, 60 unidades de cálculo.
Memória
16 GB GDDR6, barramento de 256 bits, 624 GB/s.
Consumo
263 W de potência da placa.
Preço
Não é fixado aqui: veja /prix-gpu-ia, que registra o menor preço todas as segundas e quintas-feiras.

#Avaliar uma oferta sem preço fixo

A expressão 'bom negócio' implica um preço, e o preço de uma placa muda de uma semana para outra. Em vez de citar um valor que estaria incorreto daqui a dez dias, veja o método. Calcule o custo por GB de VRAM: o preço dividido por 16 para a 7800 XT, por 12 para uma placa de 12 GB. O monitoramento do site publica esse valor para cada placa. Depois, faça a si mesmo a única pergunta que importa: a capacidade adicional permite usar um modelo que você realmente quer usar? Passar de 12 para 16 GB permite usar modelos de 20 a 24B; passar de 16 para 24 GB permite usar modelos de 30B ou mais.

Critérios para avaliar uma oferta (exemplo de cálculo, não preços)
SituaçãoCálculo a ser feitoConclusão
Oferta de uma 7800 XTPreço ÷ 16 GBCompare com o custo por GB das placas de 12 GB e 24 GB em /prix-gpu-ia.
Diferença de preço com uma placa de 12 GBDiferença dividida por 4 GB adicionaisAbaixo do custo médio por GB, a placa de 16 GB é um bom negócio
Diferença em relação a uma RTX de 16 GBQuanto o CUDA vale para vocêPague por isso somente se uma ferramenta exigir ou se a leitura do prompt for importante.
Placa usadaTestar com um modelo de 12 a 14 GB antes da compraRecuse se não houver um teste real de carregamento

Um exemplo de raciocínio, sem indicar preços: se a diferença entre uma placa de 12 GB e a 7800 XT equivale a um valor que você teria gasto de qualquer forma para usar um modelo de 24B, a questão está resolvida. Por outro lado, se você usa apenas modelos de 8 a 12B, esses 4 GB não têm utilidade, e a RX 7700 XT ou a RX 6700 XT são suficientes.

#O que cabe em 16 GB de VRAM

Com 16 GB, conte com cerca de 15 GB para o modelo e seu cache KV quando a placa não estiver responsável pela saída de vídeo. O catálogo QuelLLM apresenta abaixo os pesos em Q4; o contexto ocupa memória adicional, e a margem rapidamente se torna o fator limitante nos modelos grandes.

O que cabe em uma 7800 XT (apenas os pesos)
ModeloTamanho do modeloMargem para o contextoVeredito
Gemma 4 12B em Q8≈ 13 GB≈ 2 GBCabe, contexto curto
gpt-oss 20B em Q4≈ 13 GB≈ 2 GBCabe, com contexto curto a médio
Devstral Small 2 24B em Q4≈ 14 GB≈ 1 GBFica apertado, contexto muito curto
Gemma 4 26B-A4B em Q4≈ 16 GBnenhumaApertado demais
Granite 4.1 30B em Q4≈ 17 GBnenhumaNão cabe

A palavra-chave da tabela é a margem: um 24B em Q4 cabe, mas com um contexto de apenas alguns milhares de tokens. Para tarefas de programação com arquivos longos, a quantização do cache KV libera de um a dois gigabytes, e uma placa de 20 GB como a RX 7900 XT resolve o problema. A tabela do site sobre modelos para 16 GB, independentemente da marca da placa, detalha os compromissos da quantização.

Um comentário sobre modelos com especialistas (MoE) como gpt-oss 20B: apenas uma parte dos parâmetros é usada em cada token, o que acelera a geração, mas todos os pesos devem permanecer na memória. É o tamanho total, e não o ativo, que decide se o modelo cabe nos 16 GB. Isso explica por que um MoE de 20B está ao lado de um denso de 12B na tabela acima, com o mesmo peso de aproximadamente 13 GB.

#Taxas medidas: Vulkan ou ROCm

Os números abaixo não são medições feitas pelo site: vêm de duas discussões públicas do repositório llama.cpp, uma sobre Vulkan e outra sobre ROCm, ambas testando Llama 2 7B em Q4_0 com llama-bench. Os commits do llama.cpp, os sistemas e os drivers diferem entre as séries, portanto a diferença entre elas é uma indicação, não uma classificação definitiva.

RX 7800 XT com Llama 2 7B Q4_0 (medições públicas do llama.cpp)
BackendFlash AttentionLeitura pp512Geração tg128
Vulkannão2 017,33 t/s118,27 t/s
Vulkansim2 197,05 t/s124,86 t/s
ROCmnão2 151,81 t/s100,94 t/s
ROCmsim2 304,63 t/s95,99 t/s

Dois aprendizados se destacam. Primeiro, nessas séries, Vulkan gera mais rápido que ROCm nessa placa (118 contra 101 tokens por segundo sem Flash Attention), enquanto ROCm lê um pouco mais rápido o prompt. Em seguida, a Flash Attention acelera Vulkan, mas diminui levemente a geração sob ROCm. Se a sua prioridade for a velocidade de resposta em conversa, experimente os dois backends com o seu modelo, em vez de assumir que ROCm vence.

O rendimento em relação ao limite teórico ajuda a evitar preocupações: 624 GB/s divididos por 3,82 GB de pesos dão 163 tokens por segundo; a placa atinge 72% desse limite com Vulkan. Aplicada a modelos maiores, essa proporção fornece ordens de grandeza, a confirmar no seu equipamento.

Estimativa de 72 % do limite de 624 GB/s (cálculo, não medição)
Modelo (Q4)Tamanho do modeloLimite teóricaOrdem de grandeza
Llama 3.1 8B≈ 6 GB≈ 104 tokens/s≈ 75 tokens/s
Gemma 4 12B≈ 7 GB≈ 89 tokens/s≈ 64 tokens/s
Phi-4 14B≈ 9 GB≈ 69 tokens/s≈ 50 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 45 tokens/s≈ 32 tokens/s

#Comparação com as placas NVIDIA de 16 GB: a leitura do prompt faz a diferença

A comparação com as RTX de 16 GB envolve duas medidas. Na geração, a RX 7800 XT permanece na mesma faixa que as placas NVIDIA medidas com Vulkan. No processamento do prompt, a diferença é muito grande: um terço da velocidade de uma RTX 4070 Ti Super. Esse segundo número tem peso nos usos com documentos longos ou históricos de conversa longos, em que se espera pela primeira palavra. Para um chat curto ou um assistente de código com contexto modesto, ele tem pouco peso.

RX 7800 XT e RTX de 16 GB sob Vulkan (Llama 2 7B Q4_0, sem Flash Attention)
PlacaVRAMLeitura pp512Geração tg128
RX 7800 XT16 GB2 017,33 t/s118,27 t/s
RTX 4070 Ti Super16 GB6 099,18 t/s129,45 t/s
RTX 5070 Ti16 GB6 213,63 t/s135,63 t/s

#Fazer um 24B caber em 16 GB: os ajustes úteis

Um modelo com 24 bilhões de parâmetros em Q4 pesa cerca de 14 GB, o que deixa mal um gigabyte para o cache KV e o sistema. Quatro medidas evitam que parte do processamento seja transferida para a CPU, o que faria a velocidade cair. A primeira é limitar a janela de contexto ao que você realmente precisa, pois o cache cresce a cada token. A segunda é quantizar o cache KV, o que libera de um a dois gigabytes. A terceira é fechar aplicativos que reservam VRAM, como um navegador com aceleração de hardware ou um jogo. A quarta é conectar o monitor à GPU integrada do processador, quando ela existir, o que devolve à placa AMD a memória que a exibição ocupava.

Contexto
Defina a janela conforme a necessidade real: 4.000 a 8.000 tokens são suficientes para a maioria das conversas.
Cache KV
Quantize-o em 8 bits para liberar VRAM, monitorando a qualidade nas suas tarefas.
Exibição
Use a saída de vídeo da placa integrada quando existir.
Verificação
Após o carregamento, ollama ps deve exibir 100 % GPU; qualquer outra proporção indica que parte do modelo passou para a RAM do sistema.

O guia sobre a janela de contexto explica por que um histórico longo consome tanta memória quanto o próprio modelo em placas pequenas.

#Configuração inicial

  1. 01
    Escolher o sistema
    No Linux, a AMD oferece suporte às Radeon RX 7000 apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. No Windows, o Ollama utiliza uma pilha ROCm v7 ou HIP7.
  2. 02
    Instalar Ollama
    Siga a documentação do Ollama: o driver ROCm v7 é obrigatório no Linux. O Vulkan está ativado por padrão e serve como alternativa de fallback.
  3. 03
    Carregar um modelo que cabe
    Escolha um 12B em Q8 ou um 20B em Q4 antes de experimentar um 24B. Verifique com ollama ps se ele está inteiramente na GPU.
  4. 04
    Comparar Vulkan e ROCm
    Inicie o llama-bench com os dois backends no seu modelo, com e sem Flash Attention, e mantenha o mais rápido para o seu uso.
Terminal
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Veredito 2026

Uma boa opção se
Se você busca modelos de 20 a 24B e o preço por GB de VRAM em /prix-gpu-ia é inferior ao das placas próximas com 12 GB.
Não é uma boa ideia se
Você continua com modelos de 8 a 12B: uma placa de 12 GB é suficiente, e você paga por gigabytes que não utiliza.
Evitar
Comprar sem teste de carregamento de um modelo de 12 a 14 GB quando a placa for de segunda mão.

#Perguntas frequentes

FAQ
RX 7800 XT: é um bom negócio para rodar LLMs?+
Sim, se você busca modelos com 20 a 24 bilhões de parâmetros: seus 16 GB comportam esses modelos em Q4, enquanto placas de 12 GB não conseguem. Avalie a oferta com base no custo por GB de VRAM, publicado na página de preços do site, e não apenas no preço exibido.
A RX 7800 XT é boa para LLMs em 2026?+
Gera 118 tokens por segundo em um modelo 7B em Q4_0 com Vulkan, segundo medição pública, e seus 16 GB carregam um modelo 24B em Q4. Seu ponto fraco em relação à NVIDIA é a leitura do prompt, cerca de três vezes mais lenta do que uma RTX 4070 Ti Super nessas medições.
Vulkan ou ROCm no RX 7800 XT?+
Nas duas discussões públicas do repositório llama.cpp, o Vulkan gera mais rápido (118 contra 101 tokens por segundo sem Flash Attention), e o ROCm lê o prompt um pouco mais rápido. As configurações são diferentes, então teste os dois com seu modelo e escolha o mais rápido.
RX 7800 XT ou RX 7700 XT para IA local?+
A 7800 XT traz 4 GB a mais de VRAM, permitindo acesso a modelos de 20 a 24B, e 624 GB/s de largura de banda contra 432. Se você permanecer com modelos de 8 a 14B, a 7700 XT é suficiente; caso contrário, a diferença de preço geralmente se justifica.
Quais modelos cabem em uma RX 7800 XT de 16 GB?+
Gemma 4 12B em Q8 e gpt-oss 20B em Q4 pesam aproximadamente 13 GB, Devstral Small 2 24B em Q4 cerca de 14 GB, com um contexto curto. Um modelo de 26 a 30B em Q4 ultrapassa 16 GB de pesos e não cabe inteiro.
A RX 7800 XT é suportada pelo Ollama?+
Sim, tanto no Linux quanto no Windows, de acordo com a documentação do Ollama, com o driver ROCm v7 no Linux. A AMD também lista a placa no ROCm, com o alvo gfx1101, mas apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 ou RHEL 9.7. Vulkan, ativado por padrão no Ollama, serve como alternativa de reserva.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.