Qual LLM para Radeon RX 7700 XT (12 GB) ?
A Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) tem suporte oficial do ROCm e do Ollama, tanto no Linux quanto no Windows. Ela executa sem limitações os modelos de 8 a 14 bilhões de parâmetros em Q4, mas não chega aos modelos de 20 a 24B, que exigem de 13 a 14 GB. Nenhuma taxa de geração foi publicada para ela nos scoreboards do llama.cpp: seu desempenho fica entre o de uma RX 6700 XT e o de uma RX 7800 XT.
O valor da RX 7700 XT está sobretudo no que seus 12 GB permitem fazer e em sua posição na linha de produtos: mais rápida e com melhor suporte do que a geração anterior, mas ainda abaixo do patamar de 16 GB que permite rodar modelos de 20 a 24B. Aqui você encontra informações para decidir se ela é suficiente, com medições citadas e estimativas claramente identificadas.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: Radeon RX 9070 XT 16 GB.
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que a RX 7700 XT faz em 2026
Uma RX 7700 XT é adequada para um LLM local de tamanho médio: seus 12 GB acomodam Llama 3.1 8B, Gemma 4 12B ou Phi-4 14B em Q4 com espaço para o contexto. Sua largura de banda de 432 GB/s, 12,5% superior à da RX 6700 XT, define o limite de geração: cerca de 113 tokens por segundo no modelo de referência de 7B dos scoreboards, contra 163 para a RX 7800 XT. Ela tem uma vantagem clara sobre a 6700 XT: o ROCm e o Ollama a listam oficialmente, inclusive no Windows. Seu ponto fraco é a capacidade, que a exclui dos modelos com 20 a 24 bilhões de parâmetros, para os quais os 16 GB da 7800 XT se tornam valiosos.
- Arquitetura
- RDNA 3, chip Navi 32 montado em chiplets (1 GCD e 3 MCD), lançado em 6 de setembro de 2023.
- Cálculo
- 3.456 processadores de fluxo, 54 unidades de computação.
- Memória
- 12 GB GDDR6, bus de 192 bits, 432 GB/s.
- Consumo
- 245 W de potência da placa.
- Preço
- Não indicado aqui: consulte /prix-gpu-ia para o menor preço registrado a cada semana.
#ROCm, Ollama e Windows: suporte oficial
Esse é o ponto que a diferencia da geração anterior. A tabela de compatibilidade da AMD lista a RX 7700 XT como RDNA 3, com alvo gfx1101, assim como a RX 7800 XT. A documentação do Ollama a inclui entre as placas compatíveis no Linux e no Windows. Uma ressalva pesa na escolha do sistema: segundo a AMD, as Radeon RX 7000 e 9000 têm suporte apenas no Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Outra distribuição pode funcionar, mas sem garantia. O Vulkan continua sendo a alternativa de segurança: o Ollama o ativa por padrão quando o backend está instalado.
| Ambiente | Status | Fonte |
|---|---|---|
| ROCm no Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | Oficial, alvo gfx1101 | Tabela de compatibilidade AMD |
| Ollama no Linux | Lista das placas suportadas | Documentação Ollama, ROCm v7 exigido |
| Ollama no Windows | Lista das placas suportadas | Documentação Ollama, pilha ROCm v7 / HIP7 |
| Vulkan (Ollama, llama.cpp) | Alternativa generalista | Ativado por padrão em Ollama |
#O que cabe em 12 GB de VRAM
Em uma placa de 12 GB, considere cerca de 11 GB para o modelo e seu cache KV, caso ela não seja usada para exibir a imagem na tela. Os pesos indicados vêm do catálogo QuelLLM; o cache KV ocupa memória adicional e cresce com o comprimento da conversa.
| Modelo | Pesos em Q4 | Margem para o contexto | Veredito |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5 GB | Muito confortável |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 GB | Confortável, contexto longo possível |
| Phi-4 14B | ≈ 9 GB | ≈ 2 GB | Cabe; é preciso limitar o contexto |
| gpt-oss 20B | ≈ 13 GB | nenhuma | Excede a capacidade da VRAM, com offload parcial para o processador |
| Devstral Small 2 24B | ≈ 14 GB | nenhuma | São necessários pelo menos 16 GB |
Para ir além de 14B sem trocar de placa, existem duas opções: quantizar o cache KV para recuperar um ou dois gigabytes, ou escolher um modelo com especialistas (MoE), em que apenas alguns parâmetros ficam ativos por token. A memória ocupada continua correspondendo ao tamanho completo do modelo, então um MoE de 20B não cabe mais facilmente em 12 GB, mas gera mais rápido se couber.
- Qual LLM para 12 GB de VRAM, independentemente da placa
- Quantizar o cache KV para liberar VRAM
- Calculadora de VRAM para seu modelo e seu contexto
#Taxa de geração: o que sabemos e o que estimamos
Sejamos precisos sobre as evidências disponíveis: as duas discussões públicas no repositório llama.cpp, uma com Vulkan e outra com ROCm, que listam placas AMD com o mesmo modelo (Llama 2 7B em Q4_0), não contêm nenhuma linha referente à RX 7700 XT no momento da redação. Não fizemos nenhuma medição por conta própria. O que podemos fazer é situá-la entre duas placas com resultados medidos: a RX 6700 XT com 83,88 tokens por segundo em geração (largura de banda de 384 GB/s) e a RX 7800 XT com 118,27 (624 GB/s), ambas com Vulkan.
O raciocínio com base na largura de banda dá um limite máximo: 432 GB/s divididos por 3,82 GB de pesos resultam em cerca de 113 tokens por segundo no modelo de referência de 7B. As placas AMD da mesma discussão atingem entre 59 % e 83 % desse limite (83 % para a 6700 XT, 72 % para a 7800 XT). Com base nisso, um valor entre 65 e 95 tokens por segundo parece plausível para a 7700 XT: é uma hipótese de trabalho, não um resultado, a confirmar com llama-bench.
| Modelo (Q4) | Tamanho do modelo | Teto com 432 GB/s | Estimativa de 60 a 80 % do limite |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 72 tokens/s | ≈ 43 a 58 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 62 tokens/s | ≈ 37 a 49 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 48 tokens/s | ≈ 29 a 38 tokens/s |
Para conversar, qualquer velocidade acima de cerca de dez tokens por segundo permite uma leitura confortável; essas estimativas ficam, portanto, bem acima do mínimo necessário para o uso, mesmo com uma margem de erro significativa.
#Em comparação com suas concorrentes mais próximas: 6700 XT, 7800 XT e RTX 4070
A escolha costuma ser feita entre três placas semelhantes. As medições publicadas com Vulkan ajudam a situar a RTX 4070, uma das placas de 12 GB da geração Ada mencionadas na discussão: 92,29 tokens por segundo na geração e 3.179 na leitura do prompt. Seus 12 GB, assim como os da 7700 XT, limitam as duas placas aos mesmos modelos; a diferença está no ecossistema de software, na leitura do prompt, na eficiência energética e no preço. As taxas da RX 7700 XT ainda precisam ser medidas; as das outras três já foram publicadas.
| Placa | VRAM | Largura de banda | Leitura pp512 | Geração tg128 |
|---|---|---|---|---|
| RX 6700 XT | 12 GB | 384 GB/s | 1 051,20 t/s | 83,88 t/s |
| RX 7700 XT | 12 GB | 432 GB/s | não publicado | não publicado |
| RTX 4070 | 12 GB | não citado | 3 179,37 t/s | 92,29 t/s |
| RX 7800 XT | 16 GB | 624 GB/s | 2 017,33 t/s | 118,27 t/s |
Leitura dessa tabela: passar da 7700 XT para a 7800 XT não custa apenas mais velocidade, ela adiciona 4 GB de VRAM, ou seja, acesso a modelos de 20 a 24B. É o único critério que realmente muda o que você pode executar. Se seu uso é um 8B ou um 12B, a 7700 XT não é limitante; se você busca modelos de código de 24B, sim.
- Radeon RX 7800 XT, o mesmo chip com 16 GB
- Radeon RX 6700 XT, a geração anterior com 12 GB
- RTX 4070: a alternativa NVIDIA de 12 GB
#Primeiros passos no Linux
- 01Verificar o sistemaVerifique se sua distribuição está entre Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 ou RHEL 9.7, as únicas versões listadas pela AMD para esta placa.
- 02Instalar o driver ROCmOllama exige o driver ROCm v7 no Linux. Instale com o utilitário amdgpu-install descrito na documentação da AMD.
- 03Instalar Ollama e depois um modeloBaixe Gemma 4 12B em Q4_K_M ou um modelo de 8B, depois execute-o com ollama run.
- 04Verificar se a GPU está sendo utilizadaExecute ollama ps: a coluna do processador deve indicar execução na GPU. Caso a placa não seja detectada, adicione o usuário ollama ao grupo render.
- 05Medir e compararExecute o llama-bench com o GGUF da discussão pública para comparar sua placa com as medições dos outros e publicar a sua.
No Windows, a documentação do Ollama prevê uma pilha ROCm v7 ou HIP7 para as Radeon RX 7000; a instalação se limita ao driver Radeon atualizado e, em seguida, ao Ollama. O guia sobre Ollama e GPUs AMD detalha as variáveis de ambiente úteis para selecionar uma placa quando o sistema tem várias.
#Quando 12 GB já não são suficientes
O limite é claro: acima de 11 GB de peso, o modelo não cabe mais inteiramente na VRAM. Ollama e llama.cpp transferem então parte das camadas para o processador, e a velocidade despenca porque a memória do sistema é muito mais lenta que a GDDR6. Três situações se repetem: um modelo de código de 24B, um contexto longo em um 14B, ou um segundo modelo carregado ao mesmo tempo para o RAG. Cada uma é resolvida com VRAM, não com poder de cálculo.
| Seu uso | 12 GB são suficientes? | O que muda a seguir |
|---|---|---|
| Chat, resumo, tradução com um 8B a 12B | Sim | Nada |
| Assistente de código com um 14B, contexto curto | Sim | Monitorar o cache KV |
| Modelo de código 24B ou gpt-oss 20B | Não | Optar por no mínimo 16 GB |
| RAG com geração, embeddings e reranker carregados juntos | Apenas | Optar por 16 GB para evitar idas e vindas |
| Contexto de 32.000 tokens ou mais em um 14B | Não | Quantizar o cache KV ou usar 16 GB |
Antes de comprar a placa usada, verifique três pontos concretos. A potência de 245 W da placa exige uma fonte de alimentação adequada e dois conectores de alimentação PCIe corretamente conectados. O modelo exato importa pouco para o LLM, pois a memória de 12 GB é a mesma em todos os fabricantes; só a qualidade da refrigeração muda, o que é relevante para sessões longas de geração. Por fim, teste a placa com um modelo real de 9 a 10 GB antes de confirmar a compra: é o único teste que exige a maior parte dos 12 GB de memória e a releitura contínua dos pesos realizada por um LLM, algo que não tem nada a ver com um jogo de videogame.
#Veredito 2026
- Se você já a possui
- Mantenha-a: ela atende a tudo até 14B com suporte oficial, sem precisar de soluções alternativas.
- Se você comprar usado
- Compare o preço com o de uma RX 7800 XT em /prix-gpu-ia: se a diferença for pequena, vale a pena pagar por ela para ter os 4 GB adicionais da 7800 XT.
- Se você busca modelos de 24B
- Passe diretamente para 16 GB ou mais: não é o desempenho, mas a capacidade que limita.
- Preços das placas de vídeo para IA local, registrados duas vezes por semana
- Documentação do Ollama: GPUs AMD compatíveis
- Tabela de compatibilidade ROCm da AMD
- Placar Vulkan do repositório llama.cpp
#Perguntas frequentes
A RX 7700 XT é boa para LLMs locais?+
Quais modelos rodar em 12 GB com uma RX 7700 XT?+
Quantos tokens por segundo a RX 7700 XT consegue?+
A RX 7700 XT funciona com Ollama no Windows?+
RX 7700 XT ou RX 7800 XT para IA local?+
É necessário usar Ubuntu para utilizar a RX 7700 XT com ROCm?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.