Qual LLM executar em uma placa AMD Radeon 6700XT?

A busca “6700xt llm” é frequente entre quem tem uma placa da geração RDNA 2 e quer um modelo local sem comprar outra GPU. Boa notícia para a combinação 6700xt llm: os 12 GB de GDDR6 dessa placa são suficientes para modelos de 7 a 14 bilhões de parâmetros com quantização de 4 bits, com uma taxa de geração confortável para chat, código e resumo de documentos. A principal restrição não é a capacidade de processamento, mas a memória de vídeo, e o segundo obstáculo está no software: a RX 6700 XT não é oficialmente compatível com o ROCm, o que exige um ajuste ou o uso do backend Vulkan. Este artigo detalha as especificações úteis, a VRAM por quantização, as taxas de geração realistas e as licenças, depois responde às perguntas frequentes antes de orientar você para o configurador.

A RX 6700 XT diante da inferência local

No papel, a Radeon RX 6700 XT é uma placa para jogos de 2021. Para um LLM, três números realmente importam.

Para efeito de comparação, uma placa de 16 GB como a descrita no guia de LLM Radeon RX 6800 XT permite executar modelos de 24B em Q4, e uma placa de 24 GB como a RX 7900 XTX atinge 32B. A 6700 XT permanece na classe de 12 GB, a mesma da RTX 3060 12 GB da NVIDIA. O guia dedicado à RX 6700 XT e a seleção melhor LLM para Radeon RX 6700 XT listam os modelos do catálogo que cabem nesse limite de memória.

Consumo de VRAM por nível de quantização: Q4, Q5, Q8, FP16

A regra de cálculo é simples: número de parâmetros × bytes por parâmetro, mais o cache KV, que cresce com o comprimento do contexto. As ordens de grandeza abaixo pressupõem um contexto de 8 192 tokens e um cache KV de 8 bits; elas são estimadas a partir dos arquivos GGUF comuns.

O ponto de virada é claro: acima de 12 GB, o llama.cpp e o Ollama transferem as camadas restantes para o processador, e a taxa de geração cai por um fator de 5 a 10. O guia « qual LLM para 12 GB de VRAM » detalha as combinações tamanho × quantização × contexto que permanecem 100% na GPU.

O que o topo do catálogo não conseguirá executar

Parte do catálogo QualLLM está fora do alcance de uma 6700 XT, e é melhor dizer isso claramente do que criar a expectativa de um milagre de software.

O caso-limite interessante é o dos MoE de cerca de 120B com poucos parâmetros ativos. Qwen 3.5 122B-A10B pesa ~73 GB em Q4 sob licença Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 GB com apenas 6B ativos, e Mistral Small 4 ~72 GB sob a licença Apache 2.0. Com 64 GB de RAM do sistema e os 12 GB da placa, o llama.cpp pode carregar esses modelos transferindo o processamento dos especialistas para a CPU. A taxa de geração obtida fica então em alguns tokens por segundo, estimada entre 3 e 8 conforme a RAM e a CPU, a ser confirmada na sua configuração. Isso é utilizável para processamento em lote à noite, não para um chat interativo. Os pesos estão publicados em a página da Alibaba no Hugging Face et a página Mistral no Hugging Face.

Tokens/s reais e escolha do software

No RDNA 2, a taxa de transferência depende tanto do backend quanto do modelo. Duas opções funcionam.

Ordens de grandeza medidas pela comunidade em uma 6700 XT, a confirmar na sua máquina:

Para uma interface de chat que funcione sobre o Ollama, Open WebUI pode ser implantado em um contêiner e gerencia o histórico, os documentos e vários modelos.

Licenças e casos de uso concretos

A licença determina o que você pode fazer com as saídas e se o modelo pode ser usado em um produto. O catálogo mostra a licença de cada ficha; as grandes famílias presentes nas versões compatíveis com 12 GB são Apache 2.0, MIT, Llama Community e algumas licenças próprias dos fornecedores. O filtro por licença do catálogo permite excluir de imediato as licenças com cláusula de restrição comercial.

O que uma 6700 XT faz bem no dia a dia:

Para comparar pontuações entre modelos, o Open LLM Leaderboard continua sendo a referência pública, com a ressalva habitual: um benchmark mede uma tarefa específica, não seu uso.

É preciso trocar a placa?

Se você esbarrar no limite de 12 GB, existem três patamares entre as opções da AMD.

Le comparador coloca duas fichas lado a lado para mostrar o que a VRAM adicional realmente libera em um determinado modelo.

FAQ

P: A RX 6700 XT é compatível com o ROCm?

Não oficialmente. A AMD não lista o gfx1031 entre os alvos compatíveis com ROCm. Na prática, Ollama e llama.cpp compilados para ROCm funcionam forçando HSA_OVERRIDE_GFX_VERSION=10.3.0, que apresenta a placa como um gfx1030. Se essa configuração causar problemas, o backend Vulkan do llama.cpp oferece uma taxa de transferência comparável sem depender do ROCm.

P: Qual é o tamanho máximo de modelo em 12 GB?

Um 14B em Q4 ou Q5 permanece inteiramente na VRAM com 8k de contexto. Um 24B ou 27B exige um Q3 agressivo ou offload parcial para a CPU, com uma queda acentuada na taxa de geração. Os MoE de 30B com 3B ativos são o melhor equilíbrio acima de 14B, desde que os especialistas sejam transferidos para o processador.

P: É possível executar DeepSeek R1 671B ou Qwen 3 235B em uma 6700 XT?

Não. DeepSeek R1 671B exige ~400 GB em Q4, Qwen 3 235B-A22B ~142 GB. Nenhuma combinação de RAM + 12 GB de VRAM em um PC de mesa é suficiente. Modelos MoE de aproximadamente 120B com 6 a 10B ativos são o limite absoluto, com 64 GB de RAM e uma taxa de alguns tokens por segundo.

P: Windows ou Linux para um LLM em uma 6700 XT?

Os dois funcionam. No Windows, o backend Vulkan do llama.cpp e as builds recentes do Ollama dispensam a instalação do ROCm. No Linux, o ROCm com a variável de sobrescrita oferece um processamento do prompt um pouco mais rápido. A diferença na taxa de geração permanece em torno de 10%, segundo a estimativa, e por si só não justifica uma mudança de sistema.

P: Quanta RAM do sistema é preciso prever como complemento?

32 GB são suficientes para modelos que cabem na VRAM e para um MoE 30B-A3B com especialistas na CPU. Passar para 64 GB só faz sentido para tentar executar modelos MoE de aproximadamente 120B com offload completo para a memória RAM, como Qwen3.8 Flash Next 125B-A6B, ao custo de uma taxa de geração reduzida.

P: O contexto longo é possível com 12 GB?

Sim, com concessões. O cache KV de um modelo de 8B ocupa cerca de 1 GB para cada 8k tokens em 16 bits; ao quantizá-lo em 8 bits, um modelo de 8B em Q4 atinge 32k de contexto dentro dos 12 GB. Um modelo de 14B fica limitado a 16k nas mesmas condições. As fichas do catálogo indicam o contexto máximo suportado por cada modelo.

Conclusão

Para a busca 6700xt llm, a resposta cabe em uma frase: um modelo de 7 a 14 bilhões de parâmetros em Q4 ou Q5, carregado via Ollama com o override ROCm ou via llama.cpp usando Vulkan, roda inteiramente na VRAM a uma taxa de geração confortável. Os modelos MoE com experts transferidos para a RAM ampliam as possibilidades, mas o topo do catálogo permanece fora do alcance. Para obter a lista exata de modelos compatíveis com seus 12 GB, sua RAM e a licença desejada, acesse o configurador QualLLM.

O hardware para executar um LLM localmente

Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:

Amazon GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença do conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.