Qual LLM executar em uma placa AMD Radeon 6700XT?
A busca “6700xt llm” é frequente entre quem tem uma placa da geração RDNA 2 e quer um modelo local sem comprar outra GPU. Boa notícia para a combinação 6700xt llm: os 12 GB de GDDR6 dessa placa são suficientes para modelos de 7 a 14 bilhões de parâmetros com quantização de 4 bits, com uma taxa de geração confortável para chat, código e resumo de documentos. A principal restrição não é a capacidade de processamento, mas a memória de vídeo, e o segundo obstáculo está no software: a RX 6700 XT não é oficialmente compatível com o ROCm, o que exige um ajuste ou o uso do backend Vulkan. Este artigo detalha as especificações úteis, a VRAM por quantização, as taxas de geração realistas e as licenças, depois responde às perguntas frequentes antes de orientar você para o configurador.
A RX 6700 XT diante da inferência local
No papel, a Radeon RX 6700 XT é uma placa para jogos de 2021. Para um LLM, três números realmente importam.
- VRAM: 12 GB de GDDR6, barramento de 192 bits.
- Largura de banda da memória: 384 GB/s. É esse valor que limita a taxa de tokens/s, pois cada token gerado relê todos os pesos ativos.
- Arquitetura: RDNA 2, identificador
gfx1031, 40 unidades de computação, sem núcleos matriciais dedicados.
Para efeito de comparação, uma placa de 16 GB como a descrita no guia de LLM Radeon RX 6800 XT permite executar modelos de 24B em Q4, e uma placa de 24 GB como a RX 7900 XTX atinge 32B. A 6700 XT permanece na classe de 12 GB, a mesma da RTX 3060 12 GB da NVIDIA. O guia dedicado à RX 6700 XT e a seleção melhor LLM para Radeon RX 6700 XT listam os modelos do catálogo que cabem nesse limite de memória.
Consumo de VRAM por nível de quantização: Q4, Q5, Q8, FP16
A regra de cálculo é simples: número de parâmetros × bytes por parâmetro, mais o cache KV, que cresce com o comprimento do contexto. As ordens de grandeza abaixo pressupõem um contexto de 8 192 tokens e um cache KV de 8 bits; elas são estimadas a partir dos arquivos GGUF comuns.
- Modelo de 7 a 8B: Q4 ≈ 5 GB, Q5 ≈ 6 GB, Q8 ≈ 9 GB, FP16 ≈ 16 GB. Tudo cabe em 12 GB até Q8, inclusive, mas FP16 não cabe.
- Modelo de 12 a 14B: Q4 ≈ 8 a 9 GB, Q5 ≈ 10 GB, Q8 ≈ 15 GB. Q4 e Q5 cabem, Q8 usa também a RAM do sistema.
- Modelo de 24 a 27B: Q4 ≈ 15 a 17 GB. Não cabe inteiramente; um Q3 de 12 GB é possível, mas degrada a qualidade.
- Modelo MoE de 30B com 3B ativos: Q4 ≈ 18 GB de pesos, mas apenas os especialistas ativos são lidos a cada token. Com os especialistas transferidos para a CPU, a taxa de processamento continua adequada para uso.
O ponto de virada é claro: acima de 12 GB, o llama.cpp e o Ollama transferem as camadas restantes para o processador, e a taxa de geração cai por um fator de 5 a 10. O guia « qual LLM para 12 GB de VRAM » detalha as combinações tamanho × quantização × contexto que permanecem 100% na GPU.
O que o topo do catálogo não conseguirá executar
Parte do catálogo QualLLM está fora do alcance de uma 6700 XT, e é melhor dizer isso claramente do que criar a expectativa de um milagre de software.
- DeepSeek R1 671B: ~400 GB em Q4, licença MIT. Impossível localmente em um PC de uso comum, independentemente da placa.
- Qwen 3 235B-A22B: ~142 GB em Q4, Apache 2.0. Fora do alcance mesmo com 128 GB de RAM.
- DeepSeek V4 Flash 284B: ~170 GB em Q4, MIT. Reservado para servidores com múltiplas GPUs ou para Macs de alto padrão com memória unificada.
- GLM 5.3 Flash 320B-A18B: ~186 GB em Q4, MIT. Mesmo veredito.
O caso-limite interessante é o dos MoE de cerca de 120B com poucos parâmetros ativos. Qwen 3.5 122B-A10B pesa ~73 GB em Q4 sob licença Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 GB com apenas 6B ativos, e Mistral Small 4 ~72 GB sob a licença Apache 2.0. Com 64 GB de RAM do sistema e os 12 GB da placa, o llama.cpp pode carregar esses modelos transferindo o processamento dos especialistas para a CPU. A taxa de geração obtida fica então em alguns tokens por segundo, estimada entre 3 e 8 conforme a RAM e a CPU, a ser confirmada na sua configuração. Isso é utilizável para processamento em lote à noite, não para um chat interativo. Os pesos estão publicados em a página da Alibaba no Hugging Face et a página Mistral no Hugging Face.
Tokens/s reais e escolha do software
No RDNA 2, a taxa de transferência depende tanto do backend quanto do modelo. Duas opções funcionam.
- Ollama com ROCm: a 6700 XT não está na lista oficial, mas a variável
HSA_OVERRIDE_GFX_VERSION=10.3.0faz com que ela seja aceita como uma placa da mesma família. O procedimento completo está no guia Ollama GPU AMD ROCm; o repositório Ollama no GitHub documenta as variáveis de ambiente. - llama.cpp com Vulkan: nenhum driver específico, funciona tanto no Windows quanto no Linux. O backend é mantido no repositório llama.cpp. O desempenho na geração é próximo ao obtido com ROCm; o processamento do prompt é um pouco mais lento.
- vLLM: não é uma opção realista na RDNA 2; a documentação do vLLM é voltada para placas de datacenter e placas RDNA 3 recentes.
Ordens de grandeza medidas pela comunidade em uma 6700 XT, a confirmar na sua máquina:
- 8B em Q4_K_M: 35 a 45 tokens/s na geração.
- 14B em Q4_K_M: 18 a 25 tokens/s.
- MoE 30B-A3B com especialistas na CPU: 12 a 20 tokens/s, estimado.
- 24B em Q4 com offload parcial para a RAM do sistema: 4 a 8 tokens/s, estimado.
Para uma interface de chat que funcione sobre o Ollama, Open WebUI pode ser implantado em um contêiner e gerencia o histórico, os documentos e vários modelos.
Licenças e casos de uso concretos
A licença determina o que você pode fazer com as saídas e se o modelo pode ser usado em um produto. O catálogo mostra a licença de cada ficha; as grandes famílias presentes nas versões compatíveis com 12 GB são Apache 2.0, MIT, Llama Community e algumas licenças próprias dos fornecedores. O filtro por licença do catálogo permite excluir de imediato as licenças com cláusula de restrição comercial.
O que uma 6700 XT faz bem no dia a dia:
- Assistente de código: um modelo de 7 a 14B em Q4 responde rápido o suficiente para completar e revisar código em um editor. As pontuações do HumanEval e do LiveCodeBench nas fichas ajudam a distinguir os candidatos.
- Resumo e RAG em documentos privados: o contexto de 8k a 16k cabe na VRAM com um modelo de 8B em Q5; acima disso, reduzir a quantização do cache KV.
- Chat em francês: preferir modelos cuja ficha indique uma pontuação MMLU multilíngue ou uma avaliação em francês, em vez de apenas a pontuação MMLU em inglês.
- Processamento em lotes offline: classificação, extração de campos, reformulação, em que a taxa de processamento importa menos do que a confidencialidade.
Para comparar pontuações entre modelos, o Open LLM Leaderboard continua sendo a referência pública, com a ressalva habitual: um benchmark mede uma tarefa específica, não seu uso.
É preciso trocar a placa?
Se você esbarrar no limite de 12 GB, existem três patamares entre as opções da AMD.
- 16 GB: RX 6800 XT usada, RX 7800 XT ou RX 9060 XT nova. O benchmark da 9060 XT de 16 GB mostra o que 4 GB a mais e o RDNA 4 oferecem nos modelos 24B.
- 20 GB: RX 7900 XT, que permite acomodar um modelo 27B em Q5 na memória.
- 24 GB: RX 7900 XTX, a única placa AMD voltada ao público geral que carrega um modelo de 32B em Q4 com contexto útil.
Le comparador coloca duas fichas lado a lado para mostrar o que a VRAM adicional realmente libera em um determinado modelo.
FAQ
P: A RX 6700 XT é compatível com o ROCm?
Não oficialmente. A AMD não lista o gfx1031 entre os alvos compatíveis com ROCm. Na prática, Ollama e llama.cpp compilados para ROCm funcionam forçando HSA_OVERRIDE_GFX_VERSION=10.3.0, que apresenta a placa como um gfx1030. Se essa configuração causar problemas, o backend Vulkan do llama.cpp oferece uma taxa de transferência comparável sem depender do ROCm.
P: Qual é o tamanho máximo de modelo em 12 GB?
Um 14B em Q4 ou Q5 permanece inteiramente na VRAM com 8k de contexto. Um 24B ou 27B exige um Q3 agressivo ou offload parcial para a CPU, com uma queda acentuada na taxa de geração. Os MoE de 30B com 3B ativos são o melhor equilíbrio acima de 14B, desde que os especialistas sejam transferidos para o processador.
P: É possível executar DeepSeek R1 671B ou Qwen 3 235B em uma 6700 XT?
Não. DeepSeek R1 671B exige ~400 GB em Q4, Qwen 3 235B-A22B ~142 GB. Nenhuma combinação de RAM + 12 GB de VRAM em um PC de mesa é suficiente. Modelos MoE de aproximadamente 120B com 6 a 10B ativos são o limite absoluto, com 64 GB de RAM e uma taxa de alguns tokens por segundo.
P: Windows ou Linux para um LLM em uma 6700 XT?
Os dois funcionam. No Windows, o backend Vulkan do llama.cpp e as builds recentes do Ollama dispensam a instalação do ROCm. No Linux, o ROCm com a variável de sobrescrita oferece um processamento do prompt um pouco mais rápido. A diferença na taxa de geração permanece em torno de 10%, segundo a estimativa, e por si só não justifica uma mudança de sistema.
P: Quanta RAM do sistema é preciso prever como complemento?
32 GB são suficientes para modelos que cabem na VRAM e para um MoE 30B-A3B com especialistas na CPU. Passar para 64 GB só faz sentido para tentar executar modelos MoE de aproximadamente 120B com offload completo para a memória RAM, como Qwen3.8 Flash Next 125B-A6B, ao custo de uma taxa de geração reduzida.
P: O contexto longo é possível com 12 GB?
Sim, com concessões. O cache KV de um modelo de 8B ocupa cerca de 1 GB para cada 8k tokens em 16 bits; ao quantizá-lo em 8 bits, um modelo de 8B em Q4 atinge 32k de contexto dentro dos 12 GB. Um modelo de 14B fica limitado a 16k nas mesmas condições. As fichas do catálogo indicam o contexto máximo suportado por cada modelo.
Conclusão
Para a busca 6700xt llm, a resposta cabe em uma frase: um modelo de 7 a 14 bilhões de parâmetros em Q4 ou Q5, carregado via Ollama com o override ROCm ou via llama.cpp usando Vulkan, roda inteiramente na VRAM a uma taxa de geração confortável. Os modelos MoE com experts transferidos para a RAM ampliam as possibilidades, mas o topo do catálogo permanece fora do alcance. Para obter a lista exata de modelos compatíveis com seus 12 GB, sua RAM e a licença desejada, acesse o configurador QualLLM.
O hardware para executar um LLM localmente
Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.