Qual LLM na Radeon RX 6700 XT (12 GB) ?
A RX 6700 XT (12 GB, 384 GB/s) roda sem problemas modelos até 14B em Q4 (cerca de 9 GB) e um 12B como Gemma 4 12B com margem para o contexto. Ela usa Vulkan em vez de ROCm: não está listada na lista oficial de ROCm nem na de Ollama. Na geração, ela iguala ou supera uma RTX 3060 12 GB; na leitura de prompt, é quase duas vezes mais lenta.
Esta placa de 2021 nunca foi projetada para IA, mas nem por isso foi esquecida pelo software. Este guia explica o que ela executa hoje, por qual caminho de software, a que velocidade segundo medições publicadas e em que momento substituí-la se torna mais vantajoso financeiramente do que insistir em usá-la.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: Radeon RX 9070 XT 16 GB.
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#O que uma RX 6700 XT faz em 2026
Uma Radeon RX 6700 XT serve muito bem como placa de entrada para um LLM local, desde que você aceite três fatos: seus 12 GB de memória acomodam um modelo de 14 bilhões de parâmetros em Q4 (aproximadamente 9 GB de pesos), mas não um de 24B; a opção de software confiável para ela é o Vulkan, via llama.cpp ou Ollama, porque a AMD não a lista no ROCm; e sua velocidade de geração, limitada pela largura de banda de 384 GB/s, é suficiente para uma conversa fluida com modelos de 8B a 12B. Em um modelo de 7B em Q4_0, uma medição publicada no repositório llama.cpp mostra 83,88 tokens por segundo em geração com Vulkan, um pouco mais do que a RTX 3060 de 12 GB medida na mesma discussão. O verdadeiro ponto fraco é a leitura do prompt, que é duas vezes mais lenta.
- Arquitetura
- RDNA 2, chip Navi 22, lançada em 18 de março de 2021 (página da Wikipédia sobre a série RX 6000).
- Cálculo
- 2.560 processadores de fluxo, 40 unidades de cálculo
- Memória
- 12 GB GDDR6, barramento de 192 bits, 384 GB/s.
- Consumo
- 230 W de potência da placa.
- Preço
- Não informado aqui: os preços de equipamentos usados mudam toda semana; consulte /prix-gpu-ia.
#Ollama, ROCm ou Vulkan: o caminho que funciona
A armadilha mais comum com esta placa é procurar um guia ROCm. A documentação do Ollama lista, para Linux, as Radeon RX da 6800 à 9070 XT: a 6700 XT não está na lista. Quanto ao ROCm, a tabela de compatibilidade da AMD cita, na arquitetura RDNA 2, apenas placas profissionais como a PRO W6800 ou a V620. O Ollama amplia essa cobertura com Vulkan, ativado por padrão quando o backend está instalado, e é esse caminho que continua disponível para uma 6700 XT. Existe uma alternativa para contornar a limitação do ROCm: a variável HSA_OVERRIDE_GFX_VERSION, que força um alvo LLVM próximo, mas seu uso é restrito à experimentação.
| Caminho | Status dessa placa | Quando escolhê-lo |
|---|---|---|
| Vulkan (Ollama, llama.cpp, LM Studio) | Funciona, medido publicamente com o llama.cpp | Escolha padrão, tanto no Windows quanto no Linux |
| ROCm oficial | Placa ausente da lista do ROCm e da lista do Ollama | Evitar: nenhuma garantia de suporte |
| ROCm forçado (HSA_OVERRIDE_GFX_VERSION) | Solução alternativa documentada pelo Ollama para outras placas | Apenas para testes, sem esperar ganho comprovado |
#O que cabe em 12 GB de VRAM
A regra do site permanece a mesma: o peso do modelo em Q4 mais o cache KV mais uma margem para o driver e a exibição. Com 12 GB, um orçamento realista deixa cerca de 11 GB para o modelo e seu contexto, se a placa não alimentar a tela. Os tamanhos abaixo vêm do catálogo QuelLLM e de nossos referenciais habituais; correspondem apenas aos pesos dos modelos.
| Modelo | Pesos em Q4 | Memória restante para o contexto | Veredito |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5 a 6 GB | Roda com muita folga, permite contexto longo |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 a 5 GB | Confortável, contexto médio a longo |
| Phi-4 14B | ≈ 9 GB | ≈ 2 a 3 GB | Cabe; é preciso limitar o contexto |
| gpt-oss 20B | ≈ 13 GB | negativo | Excede a VRAM: execução parcial no processador |
| Devstral Small 2 24B | ≈ 14 GB | negativo | Grande demais para 12 GB em Q4 |
O cache KV cresce com o tamanho da conversa, o que explica por que um modelo de 14B "cabe" no papel, mas fica muito lento assim que o histórico aumenta. A calculadora de VRAM do site fornece o total exato para o seu modelo e o seu contexto, e o guia sobre a quantização do cache KV explica como recuperar um ou dois gigabytes. Para todas as placas de 12 GB, a página dedicada compara os modelos sem se limitar à AMD.
- Calculadora de VRAM para um modelo e um contexto dados
- Qual LLM para 12 GB de VRAM, independentemente da placa
- Quantizar o cache KV para economizar VRAM
#Taxas medidas e limite de largura de banda
Nenhuma taxa de processamento apresentada nesta página foi medida pelo site. Os números vêm da discussão pública no repositório llama.cpp, que compara as placas usando Vulkan com o mesmo modelo, Llama 2 7B em Q4_0 (3,56 GiB), e o comando llama-bench. Duas métricas importam nessa discussão: pp512, a velocidade de leitura de um prompt de 512 tokens, e tg128, a velocidade de escrita de 128 tokens. Para a RX 6700 XT, a discussão informa 1.051 tokens por segundo em leitura e 83,88 em geração; com a Flash Attention ativada, 1.011 e 81,86.
Este resultado pode ser comparado a um limite simples: durante a geração, cada token exige que a placa releia todos os pesos, portanto a velocidade máxima gira em torno da largura de banda dividida pelo tamanho do modelo. Aqui, 384 GB/s para 3,82 GB de pesos dão um limite teórico de 100 tokens por segundo; a placa atinge 83% desse limite, uma boa eficiência, superior à de várias placas mais recentes mencionadas na mesma discussão.
| Modelo (Q4) | Tamanho do modelo | Limite teórico com 384 GB/s | Ordem de grandeza realista (83 %) |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 64 tokens/s | ≈ 50 a 55 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 55 tokens/s | ≈ 45 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 43 tokens/s | ≈ 35 tokens/s |
Essas estimativas pressupõem que o desempenho medido no modelo de 7B se mantenha nos modelos maiores, o que não é garantido: um driver, uma versão do llama.cpp ou uma quantização diferente pode alterar o resultado em vários pontos. Quanto à leitura dos prompts, considere apenas a proporção entre as placas: essa leitura é o que pesa em um uso de RAG com documentos longos.
#Em comparação com a RTX 3060 de 12 GB: geração mais rápida, processamento do prompt mais lento
A comparação habitual aponta a RTX 3060 12 GB como vencedora graças ao CUDA. As medições publicadas com Vulkan relativizam essa conclusão automática. Na geração, a RX 6700 XT supera a RTX 3060 nos dois modos; na leitura do prompt, a RTX 3060 tem desempenho quase duas vezes melhor. As duas séries vêm da mesma discussão, mas de versões diferentes do llama.cpp: interprete a diferença como uma ordem de grandeza, não como uma classificação definitiva.
| Medição | RX 6700 XT | RTX 3060 (12 GB) |
|---|---|---|
| Leitura do prompt (pp512), sem Flash Attention | 1 051,20 t/s | 1 815,70 t/s |
| Geração (tg128), sem Flash Attention | 83,88 t/s | 75,94 t/s |
| Leitura do prompt (pp512), com Flash Attention | 1 010,90 t/s | 2 012,88 t/s |
| Geração (tg128), com Flash Attention | 81,86 t/s | 80,59 t/s |
Consequência prática: para conversar com um modelo, as duas placas se equivalem; para fazer perguntas sobre um documento longo, a RTX 3060 responde mais rápido com a primeira palavra. O CUDA também mantém a vantagem do ecossistema, com menos soluções alternativas que você precisa conhecer. Com preços equivalentes no mercado de usados, a RTX 3060 de 12 GB continua sendo a escolha prudente, e a 6700 XT só é um bom negócio se já estiver no seu PC ou for significativamente mais barata.
#Como começar passo a passo
- 01Verificar o driver VulkanNo Windows, o driver Radeon inclui Vulkan e o Ollama não exige nenhuma etapa adicional. No Linux, instale os componentes Vulkan do Mesa (RADV) ou o driver AMD, conforme indicado na documentação do Ollama.
- 02Instalar Ollama ou compilar llama.cppOllama ativa o Vulkan por padrão após a instalação do backend. Com o llama.cpp, compile com a opção -DGGML_VULKAN=on.
- 03Dar acesso à placa no LinuxAdicione o usuário ollama ao grupo render se a placa não for detectada. Para que o Ollama leia a VRAM livre, execute-o como root ou conceda a capacidade indicada no comando abaixo.
- 04Iniciar um primeiro modeloBaixe um 8B ou Gemma 4 12B em Q4_K_M, inicie com o comando ollama run e verifique com o comando ollama ps se o modelo está carregado na GPU e não no processador.
- 05Medir no seu ambienteExecute o llama-bench com o mesmo GGUF usado na discussão pública para comparar sua placa com os resultados apresentados nela antes de procurar uma causa para a lentidão.
Se a taxa de geração parecer baixa com RADV, a discussão do llama.cpp recomenda iniciar com a variável de ambiente RADV_PERFTEST=nogttspill, que corrige vários problemas de desempenho. Os outros ajustes Vulkan estão no guia de compilação dedicado.
#Limites e momento de mudar para outra opção
Três limitações se destacam. Primeiro, a memória: 12 GB excluem os modelos de 20 a 32 bilhões de parâmetros, faixa em que se define a qualidade dos assistentes de código e de raciocínio. Em seguida, o processamento do prompt, que torna penosas as sessões com documentos longos. Por fim, o suporte: uma placa fora da lista oficial depende de as atualizações do Vulkan e do llama.cpp continuarem a contemplá-la, sem garantia de longo prazo.
| Sua necessidade | Ficar com a RX 6700 XT? | Opção de substituição |
|---|---|---|
| Chat diário com um modelo de 8B a 12B | Sim | Nenhum |
| Assistente de código local com 14B | Sim, contexto curto | Uma placa de 16 GB se o contexto crescer |
| Modelos de 20 a 30B (gpt-oss 20B, Devstral 24B) | Não, memória insuficiente | Placa de 16 a 20 GB, página dedicada abaixo |
| RAG em grandes documentos | Possível, mas demora para gerar a primeira palavra | Placa com melhor processamento de prompts |
| Suporte oficial garantido | Não | Radeon RX 7000 ou 9000, RTX |
- Radeon RX 7700 XT, etapa RDNA 3 com 12 GB, suporte oficial
- Radeon RX 7800 XT, 16 GB para acessar modelos de 20 a 24B
#Veredito 2026
- Vale a pena
- Se já estiver em sua máquina: é uma das poucas placas de 2021 que ainda aceita um modelo de 14B em Q4 com um rendimento de geração superior a 80% do seu limite teórico.
- Compre preferencialmente uma RTX 3060 de 12 GB
- Se você estiver começando do zero e tiver em mente o mesmo orçamento: leitura de prompt duas vezes mais rápida e nenhuma solução alternativa de software necessária.
- Mude de placa
- Assim que você quiser modelos de 20 a 30 bilhões de parâmetros; os preços mudam toda semana, e a página /prix-gpu-ia informa o custo por GB de VRAM.
- Preços das placas gráficas para IA local, atualizados duas vezes por semana
- Documentação Ollama: GPUs suportadas, ROCm e Vulkan
- Placar Vulkan do repositório llama.cpp (Llama 2 7B Q4_0)
- Compatibilidade de GPU do ROCm, documentação da AMD
#Perguntas frequentes
RX 6700 XT LLM: quais modelos podemos rodar?+
Uma 6700 XT funciona com Ollama?+
O ROCm é viável na RX 6700 XT?+
Quantos tokens por segundo em uma RX 6700 XT?+
RX 6700 XT ou RTX 3060 de 12 GB para um LLM?+
Quando é preciso desistir da RX 6700 XT para usar IA local?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.