Iniciante 11 minRadeon RX 7000

Qual LLM para Radeon RX 7700 XT (12 GB) ?

Resposta direta

A Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) tem suporte oficial do ROCm e do Ollama, tanto no Linux quanto no Windows. Ela executa sem limitações os modelos de 8 a 14 bilhões de parâmetros em Q4, mas não chega aos modelos de 20 a 24B, que exigem de 13 a 14 GB. Nenhuma taxa de geração foi publicada para ela nos scoreboards do llama.cpp: seu desempenho fica entre o de uma RX 6700 XT e o de uma RX 7800 XT.

O valor da RX 7700 XT está sobretudo no que seus 12 GB permitem fazer e em sua posição na linha de produtos: mais rápida e com melhor suporte do que a geração anterior, mas ainda abaixo do patamar de 16 GB que permite rodar modelos de 20 a 24B. Aqui você encontra informações para decidir se ela é suficiente, com medições citadas e estimativas claramente identificadas.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: Radeon RX 9070 XT 16 GB.

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que a RX 7700 XT faz em 2026

Uma RX 7700 XT é adequada para um LLM local de tamanho médio: seus 12 GB acomodam Llama 3.1 8B, Gemma 4 12B ou Phi-4 14B em Q4 com espaço para o contexto. Sua largura de banda de 432 GB/s, 12,5% superior à da RX 6700 XT, define o limite de geração: cerca de 113 tokens por segundo no modelo de referência de 7B dos scoreboards, contra 163 para a RX 7800 XT. Ela tem uma vantagem clara sobre a 6700 XT: o ROCm e o Ollama a listam oficialmente, inclusive no Windows. Seu ponto fraco é a capacidade, que a exclui dos modelos com 20 a 24 bilhões de parâmetros, para os quais os 16 GB da 7800 XT se tornam valiosos.

Arquitetura
RDNA 3, chip Navi 32 montado em chiplets (1 GCD e 3 MCD), lançado em 6 de setembro de 2023.
Cálculo
3.456 processadores de fluxo, 54 unidades de computação.
Memória
12 GB GDDR6, bus de 192 bits, 432 GB/s.
Consumo
245 W de potência da placa.
Preço
Não indicado aqui: consulte /prix-gpu-ia para o menor preço registrado a cada semana.

#ROCm, Ollama e Windows: suporte oficial

Esse é o ponto que a diferencia da geração anterior. A tabela de compatibilidade da AMD lista a RX 7700 XT como RDNA 3, com alvo gfx1101, assim como a RX 7800 XT. A documentação do Ollama a inclui entre as placas compatíveis no Linux e no Windows. Uma ressalva pesa na escolha do sistema: segundo a AMD, as Radeon RX 7000 e 9000 têm suporte apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Outra distribuição pode funcionar, mas sem garantia. O Vulkan continua sendo a alternativa de segurança: o Ollama o ativa por padrão quando o backend está instalado.

Suporte à RX 7700 XT
AmbienteStatusFonte
ROCm no Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)Oficial, alvo gfx1101Tabela de compatibilidade AMD
Ollama no LinuxLista das placas suportadasDocumentação Ollama, ROCm v7 exigido
Ollama no WindowsLista das placas suportadasDocumentação Ollama, pilha ROCm v7 / HIP7
Vulkan (Ollama, llama.cpp)Alternativa generalistaAtivado por padrão em Ollama

#O que cabe em 12 GB de VRAM

Em uma placa de 12 GB, considere cerca de 11 GB para o modelo e seu cache KV, caso ela não seja usada para exibir a imagem na tela. Os pesos indicados vêm do catálogo QuelLLM; o cache KV ocupa memória adicional e cresce com o comprimento da conversa.

O que uma 7700 XT comporta (Q4, apenas os pesos)
ModeloPesos em Q4Margem para o contextoVeredito
Llama 3.1 8B≈ 6 GB≈ 5 GBMuito confortável
Gemma 4 12B≈ 7 GB≈ 4 GBConfortável, contexto longo possível
Phi-4 14B≈ 9 GB≈ 2 GBCabe; é preciso limitar o contexto
gpt-oss 20B≈ 13 GBnenhumaExcede a capacidade da VRAM, com offload parcial para o processador
Devstral Small 2 24B≈ 14 GBnenhumaSão necessários pelo menos 16 GB

Para ir além de 14B sem trocar de placa, existem duas opções: quantizar o cache KV para recuperar um ou dois gigabytes, ou escolher um modelo com especialistas (MoE), em que apenas alguns parâmetros ficam ativos por token. A memória ocupada continua correspondendo ao tamanho completo do modelo, então um MoE de 20B não cabe mais facilmente em 12 GB, mas gera mais rápido se couber.

#Taxa de geração: o que sabemos e o que estimamos

Sejamos precisos sobre as evidências disponíveis: as duas discussões públicas no repositório llama.cpp, uma com Vulkan e outra com ROCm, que listam placas AMD com o mesmo modelo (Llama 2 7B em Q4_0), não contêm nenhuma linha referente à RX 7700 XT no momento da redação. Não fizemos nenhuma medição por conta própria. O que podemos fazer é situá-la entre duas placas com resultados medidos: a RX 6700 XT com 83,88 tokens por segundo em geração (largura de banda de 384 GB/s) e a RX 7800 XT com 118,27 (624 GB/s), ambas com Vulkan.

O raciocínio com base na largura de banda dá um limite máximo: 432 GB/s divididos por 3,82 GB de pesos resultam em cerca de 113 tokens por segundo no modelo de referência de 7B. As placas AMD da mesma discussão atingem entre 59 % e 83 % desse limite (83 % para a 6700 XT, 72 % para a 7800 XT). Com base nisso, um valor entre 65 e 95 tokens por segundo parece plausível para a 7700 XT: é uma hipótese de trabalho, não um resultado, a confirmar com llama-bench.

Limite teórico por modelo em uma 7700 XT (cálculo)
Modelo (Q4)Tamanho do modeloTeto com 432 GB/sEstimativa de 60 a 80 % do limite
Llama 3.1 8B≈ 6 GB≈ 72 tokens/s≈ 43 a 58 tokens/s
Gemma 4 12B≈ 7 GB≈ 62 tokens/s≈ 37 a 49 tokens/s
Phi-4 14B≈ 9 GB≈ 48 tokens/s≈ 29 a 38 tokens/s

Para conversar, qualquer velocidade acima de cerca de dez tokens por segundo permite uma leitura confortável; essas estimativas ficam, portanto, bem acima do mínimo necessário para o uso, mesmo com uma margem de erro significativa.

#Em comparação com suas concorrentes mais próximas: 6700 XT, 7800 XT e RTX 4070

A escolha costuma ser feita entre três placas semelhantes. As medições publicadas com Vulkan ajudam a situar a RTX 4070, uma das placas de 12 GB da geração Ada mencionadas na discussão: 92,29 tokens por segundo na geração e 3.179 na leitura do prompt. Seus 12 GB, assim como os da 7700 XT, limitam as duas placas aos mesmos modelos; a diferença está no ecossistema de software, na leitura do prompt, na eficiência energética e no preço. As taxas da RX 7700 XT ainda precisam ser medidas; as das outras três já foram publicadas.

7700 XT e placas semelhantes (Llama 2 7B Q4_0, Vulkan, sem Flash Attention)
PlacaVRAMLargura de bandaLeitura pp512Geração tg128
RX 6700 XT12 GB384 GB/s1 051,20 t/s83,88 t/s
RX 7700 XT12 GB432 GB/snão publicadonão publicado
RTX 407012 GBnão citado3 179,37 t/s92,29 t/s
RX 7800 XT16 GB624 GB/s2 017,33 t/s118,27 t/s

Leitura dessa tabela: passar da 7700 XT para a 7800 XT não custa apenas mais velocidade, ela adiciona 4 GB de VRAM, ou seja, acesso a modelos de 20 a 24B. É o único critério que realmente muda o que você pode executar. Se seu uso é um 8B ou um 12B, a 7700 XT não é limitante; se você busca modelos de código de 24B, sim.

#Primeiros passos no Linux

  1. 01
    Verificar o sistema
    Verifique se sua distribuição está entre Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 ou RHEL 9.7, as únicas versões listadas pela AMD para esta placa.
  2. 02
    Instalar o driver ROCm
    Ollama exige o driver ROCm v7 no Linux. Instale com o utilitário amdgpu-install descrito na documentação da AMD.
  3. 03
    Instalar Ollama e depois um modelo
    Baixe Gemma 4 12B em Q4_K_M ou um modelo de 8B, depois execute-o com ollama run.
  4. 04
    Verificar se a GPU está sendo utilizada
    Execute ollama ps: a coluna do processador deve indicar execução na GPU. Caso a placa não seja detectada, adicione o usuário ollama ao grupo render.
  5. 05
    Medir e comparar
    Execute o llama-bench com o GGUF da discussão pública para comparar sua placa com as medições dos outros e publicar a sua.
Terminal
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

No Windows, a documentação do Ollama prevê uma pilha ROCm v7 ou HIP7 para as Radeon RX 7000; a instalação se limita ao driver Radeon atualizado e, em seguida, ao Ollama. O guia sobre Ollama e GPUs AMD detalha as variáveis de ambiente úteis para selecionar uma placa quando o sistema tem várias.

#Quando 12 GB já não são suficientes

O limite é claro: acima de 11 GB de peso, o modelo não cabe mais inteiramente na VRAM. Ollama e llama.cpp transferem então parte das camadas para o processador, e a velocidade despenca porque a memória do sistema é muito mais lenta que a GDDR6. Três situações se repetem: um modelo de código de 24B, um contexto longo em um 14B, ou um segundo modelo carregado ao mesmo tempo para o RAG. Cada uma é resolvida com VRAM, não com poder de cálculo.

Vale a pena continuar com 12 GB?
Seu uso12 GB são suficientes?O que muda a seguir
Chat, resumo, tradução com um 8B a 12BSimNada
Assistente de código com um 14B, contexto curtoSimMonitorar o cache KV
Modelo de código 24B ou gpt-oss 20BNãoOptar por no mínimo 16 GB
RAG com geração, embeddings e reranker carregados juntosApenasOptar por 16 GB para evitar idas e vindas
Contexto de 32.000 tokens ou mais em um 14BNãoQuantizar o cache KV ou usar 16 GB

Antes de comprar a placa usada, verifique três pontos concretos. A potência de 245 W da placa exige uma fonte de alimentação adequada e dois conectores de alimentação PCIe corretamente conectados. O modelo exato importa pouco para o LLM, pois a memória de 12 GB é a mesma em todos os fabricantes; só a qualidade da refrigeração muda, o que é relevante para sessões longas de geração. Por fim, teste a placa com um modelo real de 9 a 10 GB antes de confirmar a compra: é o único teste que exige a maior parte dos 12 GB de memória e a releitura contínua dos pesos realizada por um LLM, algo que não tem nada a ver com um jogo de videogame.

#Veredito 2026

Se você já a possui
Mantenha-a: ela atende a tudo até 14B com suporte oficial, sem precisar de soluções alternativas.
Se você comprar usado
Compare o preço com o de uma RX 7800 XT em /prix-gpu-ia: se a diferença for pequena, vale a pena pagar por ela para ter os 4 GB adicionais da 7800 XT.
Se você busca modelos de 24B
Passe diretamente para 16 GB ou mais: não é o desempenho, mas a capacidade que limita.

#Perguntas frequentes

FAQ
A RX 7700 XT é boa para LLMs locais?+
Sim, para modelos de 8 a 14 bilhões de parâmetros em Q4, com suporte oficial do ROCm e do Ollama. Seus 12 GB a limitam a modelos menores que os de 20 a 24B, o que é sua principal desvantagem em comparação com a RX 7800 XT e seus 16 GB.
Quais modelos rodar em 12 GB com uma RX 7700 XT?+
Llama 3.1 8B, Gemma 4 12B e Phi-4 14B em Q4, ou seja, 6 a 9 GB de pesos, com espaço para o contexto. Um modelo de 20 a 24B pesa 13 a 14 GB em Q4: ele excede a capacidade da VRAM e passa a ser executado parcialmente no processador, com uma redução significativa de velocidade.
Quantos tokens por segundo a RX 7700 XT consegue?+
Nenhuma medição publicada nas discussões do repositório llama.cpp. O cálculo indica um limite de aproximadamente 113 tokens por segundo em um modelo de 7B em Q4_0, e normalmente observa-se entre 59% e 83% desse limite em placas AMD semelhantes. Faça você mesmo a medição com llama-bench antes de apresentar números.
A RX 7700 XT funciona com Ollama no Windows?+
Sim: a documentação do Ollama a inclui entre as placas Radeon RX compatíveis no Windows, exigindo uma pilha ROCm v7 ou HIP7. No Linux, ela também está listada, com o driver ROCm v7. O Vulkan, ativado por padrão no Ollama, serve como alternativa caso a detecção falhe.
RX 7700 XT ou RX 7800 XT para IA local?+
A 7800 XT, se você busca modelos de 20 a 24 bilhões de parâmetros, devido aos 16 GB de memória e à sua largura de banda de 624 GB/s contra 432 GB/s. A 7700 XT é suficiente se seu uso permanecer entre 8 e 14 bilhões de parâmetros. Compare os preços atuais antes de decidir.
É necessário usar Ubuntu para utilizar a RX 7700 XT com ROCm?+
A AMD oferece suporte oficial às Radeon RX 7000 apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Outra distribuição pode funcionar, mas sem suporte garantido. No Windows, o Ollama se baseia em uma pilha ROCm v7 ou HIP7; Vulkan continua sendo uma opção em todos os sistemas.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.