Iniciante 11 minRadeon RX 6000

Qual LLM na Radeon RX 6700 XT (12 GB) ?

Resposta direta

A RX 6700 XT (12 GB, 384 GB/s) roda sem problemas modelos até 14B em Q4 (cerca de 9 GB) e um 12B como Gemma 4 12B com margem para o contexto. Ela usa Vulkan em vez de ROCm: não está listada na lista oficial de ROCm nem na de Ollama. Na geração, ela iguala ou supera uma RTX 3060 12 GB; na leitura de prompt, é quase duas vezes mais lenta.

Esta placa de 2021 nunca foi projetada para IA, mas nem por isso foi esquecida pelo software. Este guia explica o que ela executa hoje, por qual caminho de software, a que velocidade segundo medições publicadas e em que momento substituí-la se torna mais vantajoso financeiramente do que insistir em usá-la.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: Radeon RX 9070 XT 16 GB.

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#O que uma RX 6700 XT faz em 2026

Uma Radeon RX 6700 XT serve muito bem como placa de entrada para um LLM local, desde que você aceite três fatos: seus 12 GB de memória acomodam um modelo de 14 bilhões de parâmetros em Q4 (aproximadamente 9 GB de pesos), mas não um de 24B; a opção de software confiável para ela é o Vulkan, via llama.cpp ou Ollama, porque a AMD não a lista no ROCm; e sua velocidade de geração, limitada pela largura de banda de 384 GB/s, é suficiente para uma conversa fluida com modelos de 8B a 12B. Em um modelo de 7B em Q4_0, uma medição publicada no repositório llama.cpp mostra 83,88 tokens por segundo em geração com Vulkan, um pouco mais do que a RTX 3060 de 12 GB medida na mesma discussão. O verdadeiro ponto fraco é a leitura do prompt, que é duas vezes mais lenta.

Arquitetura
RDNA 2, chip Navi 22, lançada em 18 de março de 2021 (página da Wikipédia sobre a série RX 6000).
Cálculo
2.560 processadores de fluxo, 40 unidades de cálculo
Memória
12 GB GDDR6, barramento de 192 bits, 384 GB/s.
Consumo
230 W de potência da placa.
Preço
Não informado aqui: os preços de equipamentos usados mudam toda semana; consulte /prix-gpu-ia.

#Ollama, ROCm ou Vulkan: o caminho que funciona

A armadilha mais comum com esta placa é procurar um guia ROCm. A documentação do Ollama lista, para Linux, as Radeon RX da 6800 à 9070 XT: a 6700 XT não está na lista. Quanto ao ROCm, a tabela de compatibilidade da AMD cita, na arquitetura RDNA 2, apenas placas profissionais como a PRO W6800 ou a V620. O Ollama amplia essa cobertura com Vulkan, ativado por padrão quando o backend está instalado, e é esse caminho que continua disponível para uma 6700 XT. Existe uma alternativa para contornar a limitação do ROCm: a variável HSA_OVERRIDE_GFX_VERSION, que força um alvo LLVM próximo, mas seu uso é restrito à experimentação.

Três caminhos de software para uma RX 6700 XT
CaminhoStatus dessa placaQuando escolhê-lo
Vulkan (Ollama, llama.cpp, LM Studio)Funciona, medido publicamente com o llama.cppEscolha padrão, tanto no Windows quanto no Linux
ROCm oficialPlaca ausente da lista do ROCm e da lista do OllamaEvitar: nenhuma garantia de suporte
ROCm forçado (HSA_OVERRIDE_GFX_VERSION)Solução alternativa documentada pelo Ollama para outras placasApenas para testes, sem esperar ganho comprovado
!
Não conte com o ROCm para esta placa
O Ollama informa que o ROCm não oferece suporte a todas as placas AMD e propõe a variável HSA_OVERRIDE_GFX_VERSION como alternativa para resolver problemas. Para a 6700 XT, nenhuma fonte mostra um ganho em relação ao Vulkan, cujos resultados estão publicados. Verifique o identificador da sua GPU com o comando rocminfo antes de qualquer tentativa.

#O que cabe em 12 GB de VRAM

A regra do site permanece a mesma: o peso do modelo em Q4 mais o cache KV mais uma margem para o driver e a exibição. Com 12 GB, um orçamento realista deixa cerca de 11 GB para o modelo e seu contexto, se a placa não alimentar a tela. Os tamanhos abaixo vêm do catálogo QuelLLM e de nossos referenciais habituais; correspondem apenas aos pesos dos modelos.

O que uma placa de 12 GB comporta (Q4, apenas os pesos)
ModeloPesos em Q4Memória restante para o contextoVeredito
Llama 3.1 8B≈ 6 GB≈ 5 a 6 GBRoda com muita folga, permite contexto longo
Gemma 4 12B≈ 7 GB≈ 4 a 5 GBConfortável, contexto médio a longo
Phi-4 14B≈ 9 GB≈ 2 a 3 GBCabe; é preciso limitar o contexto
gpt-oss 20B≈ 13 GBnegativoExcede a VRAM: execução parcial no processador
Devstral Small 2 24B≈ 14 GBnegativoGrande demais para 12 GB em Q4

O cache KV cresce com o tamanho da conversa, o que explica por que um modelo de 14B "cabe" no papel, mas fica muito lento assim que o histórico aumenta. A calculadora de VRAM do site fornece o total exato para o seu modelo e o seu contexto, e o guia sobre a quantização do cache KV explica como recuperar um ou dois gigabytes. Para todas as placas de 12 GB, a página dedicada compara os modelos sem se limitar à AMD.

#Taxas medidas e limite de largura de banda

Nenhuma taxa de processamento apresentada nesta página foi medida pelo site. Os números vêm da discussão pública no repositório llama.cpp, que compara as placas usando Vulkan com o mesmo modelo, Llama 2 7B em Q4_0 (3,56 GiB), e o comando llama-bench. Duas métricas importam nessa discussão: pp512, a velocidade de leitura de um prompt de 512 tokens, e tg128, a velocidade de escrita de 128 tokens. Para a RX 6700 XT, a discussão informa 1.051 tokens por segundo em leitura e 83,88 em geração; com a Flash Attention ativada, 1.011 e 81,86.

Este resultado pode ser comparado a um limite simples: durante a geração, cada token exige que a placa releia todos os pesos, portanto a velocidade máxima gira em torno da largura de banda dividida pelo tamanho do modelo. Aqui, 384 GB/s para 3,82 GB de pesos dão um limite teórico de 100 tokens por segundo; a placa atinge 83% desse limite, uma boa eficiência, superior à de várias placas mais recentes mencionadas na mesma discussão.

Estimativa para modelos comuns (cálculo, não medição)
Modelo (Q4)Tamanho do modeloLimite teórico com 384 GB/sOrdem de grandeza realista (83 %)
Llama 3.1 8B≈ 6 GB≈ 64 tokens/s≈ 50 a 55 tokens/s
Gemma 4 12B≈ 7 GB≈ 55 tokens/s≈ 45 tokens/s
Phi-4 14B≈ 9 GB≈ 43 tokens/s≈ 35 tokens/s

Essas estimativas pressupõem que o desempenho medido no modelo de 7B se mantenha nos modelos maiores, o que não é garantido: um driver, uma versão do llama.cpp ou uma quantização diferente pode alterar o resultado em vários pontos. Quanto à leitura dos prompts, considere apenas a proporção entre as placas: essa leitura é o que pesa em um uso de RAG com documentos longos.

#Em comparação com a RTX 3060 de 12 GB: geração mais rápida, processamento do prompt mais lento

A comparação habitual aponta a RTX 3060 12 GB como vencedora graças ao CUDA. As medições publicadas com Vulkan relativizam essa conclusão automática. Na geração, a RX 6700 XT supera a RTX 3060 nos dois modos; na leitura do prompt, a RTX 3060 tem desempenho quase duas vezes melhor. As duas séries vêm da mesma discussão, mas de versões diferentes do llama.cpp: interprete a diferença como uma ordem de grandeza, não como uma classificação definitiva.

RX 6700 XT e RTX 3060 sob Vulkan (Llama 2 7B Q4_0, discussão no llama.cpp)
MediçãoRX 6700 XTRTX 3060 (12 GB)
Leitura do prompt (pp512), sem Flash Attention1 051,20 t/s1 815,70 t/s
Geração (tg128), sem Flash Attention83,88 t/s75,94 t/s
Leitura do prompt (pp512), com Flash Attention1 010,90 t/s2 012,88 t/s
Geração (tg128), com Flash Attention81,86 t/s80,59 t/s

Consequência prática: para conversar com um modelo, as duas placas se equivalem; para fazer perguntas sobre um documento longo, a RTX 3060 responde mais rápido com a primeira palavra. O CUDA também mantém a vantagem do ecossistema, com menos soluções alternativas que você precisa conhecer. Com preços equivalentes no mercado de usados, a RTX 3060 de 12 GB continua sendo a escolha prudente, e a 6700 XT só é um bom negócio se já estiver no seu PC ou for significativamente mais barata.

#Como começar passo a passo

  1. 01
    Verificar o driver Vulkan
    No Windows, o driver Radeon inclui Vulkan e o Ollama não exige nenhuma etapa adicional. No Linux, instale os componentes Vulkan do Mesa (RADV) ou o driver AMD, conforme indicado na documentação do Ollama.
  2. 02
    Instalar Ollama ou compilar llama.cpp
    Ollama ativa o Vulkan por padrão após a instalação do backend. Com o llama.cpp, compile com a opção -DGGML_VULKAN=on.
  3. 03
    Dar acesso à placa no Linux
    Adicione o usuário ollama ao grupo render se a placa não for detectada. Para que o Ollama leia a VRAM livre, execute-o como root ou conceda a capacidade indicada no comando abaixo.
  4. 04
    Iniciar um primeiro modelo
    Baixe um 8B ou Gemma 4 12B em Q4_K_M, inicie com o comando ollama run e verifique com o comando ollama ps se o modelo está carregado na GPU e não no processador.
  5. 05
    Medir no seu ambiente
    Execute o llama-bench com o mesmo GGUF usado na discussão pública para comparar sua placa com os resultados apresentados nela antes de procurar uma causa para a lentidão.
Terminal
sudo setcap cap_perfmon+ep /usr/local/bin/ollama
# llama.cpp avec Vulkan
cmake .. -DGGML_VULKAN=on -DCMAKE_BUILD_TYPE=Release
./bin/llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Se a taxa de geração parecer baixa com RADV, a discussão do llama.cpp recomenda iniciar com a variável de ambiente RADV_PERFTEST=nogttspill, que corrige vários problemas de desempenho. Os outros ajustes Vulkan estão no guia de compilação dedicado.

#Limites e momento de mudar para outra opção

Três limitações se destacam. Primeiro, a memória: 12 GB excluem os modelos de 20 a 32 bilhões de parâmetros, faixa em que se define a qualidade dos assistentes de código e de raciocínio. Em seguida, o processamento do prompt, que torna penosas as sessões com documentos longos. Por fim, o suporte: uma placa fora da lista oficial depende de as atualizações do Vulkan e do llama.cpp continuarem a contemplá-la, sem garantia de longo prazo.

Quando permanecer, quando mudar
Sua necessidadeFicar com a RX 6700 XT?Opção de substituição
Chat diário com um modelo de 8B a 12BSimNenhum
Assistente de código local com 14BSim, contexto curtoUma placa de 16 GB se o contexto crescer
Modelos de 20 a 30B (gpt-oss 20B, Devstral 24B)Não, memória insuficientePlaca de 16 a 20 GB, página dedicada abaixo
RAG em grandes documentosPossível, mas demora para gerar a primeira palavraPlaca com melhor processamento de prompts
Suporte oficial garantidoNãoRadeon RX 7000 ou 9000, RTX

#Veredito 2026

Vale a pena
Se já estiver em sua máquina: é uma das poucas placas de 2021 que ainda aceita um modelo de 14B em Q4 com um rendimento de geração superior a 80% do seu limite teórico.
Compre preferencialmente uma RTX 3060 de 12 GB
Se você estiver começando do zero e tiver em mente o mesmo orçamento: leitura de prompt duas vezes mais rápida e nenhuma solução alternativa de software necessária.
Mude de placa
Assim que você quiser modelos de 20 a 30 bilhões de parâmetros; os preços mudam toda semana, e a página /prix-gpu-ia informa o custo por GB de VRAM.

#Perguntas frequentes

FAQ
RX 6700 XT LLM: quais modelos podemos rodar?+
Modelos com até 14 bilhões de parâmetros em Q4, ou seja, cerca de 9 GB de pesos, mais o contexto: Llama 3.1 8B, Gemma 4 12B, Phi-4 14B. Um modelo de 20B como gpt-oss (cerca de 13 GB) ou um de 24B ultrapassa os 12 GB e passa parcialmente para o processador, com queda significativa de velocidade.
Uma 6700 XT funciona com Ollama?+
Sim, por Vulkan. Ollama não menciona o Vulkan em sua lista de ROCm, que começa a partir da RX 6800 no Linux, mas ativa Vulkan por padrão quando o backend é instalado. Verifique com o comando ollama ps se o modelo está realmente carregado na GPU.
O ROCm é viável na RX 6700 XT?+
Não oficialmente: a placa não aparece nem na tabela de compatibilidade ROCm da AMD, que menciona apenas placas profissionais para RDNA 2, nem na lista do Ollama. Existe uma solução alternativa por meio da variável HSA_OVERRIDE_GFX_VERSION, mas ela continua sendo experimental, e nenhuma medição pública mostra um ganho em relação ao Vulkan, cujos resultados são publicados.
Quantos tokens por segundo em uma RX 6700 XT?+
Com Llama 2 7B em Q4_0, a discussão pública no repositório llama.cpp indica 83,88 tokens por segundo na geração com Vulkan. Para Gemma 4 12B em Q4, a razão entre a largura de banda e o tamanho dos pesos sugere cerca de 45 tokens por segundo: uma estimativa calculada, a ser verificada na sua máquina com llama-bench antes de citá-la.
RX 6700 XT ou RTX 3060 de 12 GB para um LLM?+
Na geração, as duas placas têm desempenho equivalente, com a Radeon até um pouco à frente nas medições publicadas com Vulkan. Na leitura do prompt, a RTX 3060 é quase duas vezes mais rápida, e o CUDA dispensa soluções alternativas. Pelo mesmo preço no mercado de usados, a RTX 3060 de 12 GB continua sendo a escolha mais simples.
Quando é preciso desistir da RX 6700 XT para usar IA local?+
Quando você quer modelos de 20 a 32 bilhões de parâmetros, que não cabem em 12 GB, ou quando a leitura lenta de prompts longos interfere no seu uso. Nesse caso, uma placa de 16 a 20 GB, como as Radeon RX 7800 XT ou 7900 XT, é a etapa lógica seguinte.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.