Desempenho de LLM em GPU AMD Radeon 9070XT
A consulta « 9070xt llm » é frequente entre os proprietários da Radeon RX 9070 XT que desejam rodar um modelo localmente sem uma placa NVIDIA. Boa notícia: com 16 GB de GDDR6 e o suporte ROCm da arquitetura RDNA 4, uma configuração 9070xt llm é viável para a maioria dos usos pessoais, desde que você entenda suas limitações de memória. Esta página detalha as especificações da placa úteis para inferência, a VRAM consumida conforme a quantização (Q4, Q5, Q8, FP16), as taxas esperadas em tokens/segundo, os modelos do catálogo QualLLM utilizáveis com transferência de parte do processamento para a CPU, a interpretação dos benchmarks e, em seguida, os casos de uso e as ferramentas (llama.cpp, Ollama, vLLM) que realmente funcionam em hardware AMD.
Ficha técnica da RX 9070 XT para inferência
O que importa para um LLM não é a potência de cálculo bruta, mas a largura de banda da memória e a quantidade de VRAM. Em relação a esses dois pontos, a placa se situa assim:
- Arquitetura : RDNA 4, identificador ROCm gfx1201
- VRAM : 16 GB GDDR6, barramento de 256 bits
- Largura de banda : cerca de 640 GB/s (valor fornecido pelo fabricante)
- Unidades de cálculo : 64 CU, 4096 processadores de fluxo
- Consumo típico : 304 W em carga
- Suporte de software : ROCm 6.4 e versões posteriores, backend Vulkan do llama.cpp como alternativa
Para contextualizar: a largura de banda é similar à de uma RX 7900 XT, mas a VRAM permanece em 16 GB, contra 20 ou 24 GB da geração anterior. Essa é a contrapartida a considerar antes de comprar. A página da RX 9070 XT lista os modelos classificados por compatibilidade e o guia de instalação dedicado cobre a implementação passo a passo.
VRAM: o que cabe em 16 GB de acordo com a quantização
Regra prática para estimar a memória de um modelo denso: cerca de 0,55 a 0,6 GB por bilhão de parâmetros em Q4, 0,7 em Q5, 1,05 em Q8 e 2 em FP16, mais o cache KV que aumenta com o contexto. Em 16 GB, reservando 1 a 1,5 GB para o sistema e o cache KV:
- Q4 (Q4_K_M) : modelos densos com até cerca de 20 a 24 bilhões de parâmetros, contexto de 8k a 16k
- Q5 : até cerca de 16 a 18 bilhões de parâmetros
- Q8 : até cerca de 12 a 13 bilhões de parâmetros
- FP16 : até aproximadamente 7 bilhões de parâmetros, raramente útil para inferência local
Os modelos do catálogo de referência citado nesta página são todos muito maiores do que isso. Vejamos três exemplos da faixa de 118 a 128 bilhões de parâmetros, em que apenas os especialistas ativos trabalham a cada token:
- Qwen 3.5 122B-A10B : Q4 ~73 GB, Q5 ~88 GB (estimado), Q8 ~130 GB (estimado), FP16 ~245 GB (estimado). Ficha: Qwen 3.5 122B-A10B
- Mistral Small 4 (119B): Q4 ~72 GB, Q8 ~128 GB (estimado). Ficha: Mistral Small 4
- Qwen3.8 Flash Next 125B-A6B : Q4 ~72 GB, 6 bilhões de parâmetros ativos apenas. Ficha : Qwen3.8 Flash Next
Nenhum desses modelos cabe em 16 GB de VRAM. Eles permanecem interessantes para uma 9070 XT graças ao descarregamento dos especialistas para a RAM do sistema, explicado abaixo.
Velocidade em tokens por segundo: ordens de grandeza estimadas
Na geração, a taxa de geração de um modelo que cabe inteiramente na VRAM é limitada pela largura de banda: cada token exige ler todos os pesos. Com 640 GB/s, o limite teórico para um modelo de 8 GB em Q4 é de cerca de 80 tokens/s; na prática, observa-se entre 55 e 70% desse limite. Valores aproximados, todos estimadas e que devem ser confirmados com sua própria configuração:
- Modelo denso com 7 a 9 bilhões de parâmetros, Q4, 100 % na VRAM : 45 a 60 tokens/seg
- modelo denso de 12 a 14 bilhões, Q4 : 28 a 38 tokens/seg
- Modelo denso de 22 a 24 bilhões, Q4, contexto curto : 15 a 22 tokens/s
- Modelo denso com 30 bilhões ou mais, Q4 : transferência parcial do processamento para a CPU, frequentemente a 3 a 6 tokens/sec, pouco prático no dia a dia
Nos modelos com especialistas do catálogo, a velocidade de geração depende principalmente da RAM do sistema. Com 64 a 96 GB de DDR5 em canal duplo, as camadas de atenção na VRAM e os especialistas na RAM, pode-se esperar de 8 a 15 tokens/s (estimativa) em um modelo com 10 bilhões de parâmetros ativos como Qwen 3.5 122B-A10B, e de 12 a 20 tokens/s (estimativa) em Qwen3.8 Flash Next 125B-A6B. O processamento do prompt continua muito mais lento do que com o modelo inteiramente na VRAM. O método está documentado no GitHub do llama.cpp via as opções de posicionamento dos tensores no CPU. O comparador de benchmarks locais fornece números obtidos em outras placas para calibrar suas expectativas.
Modelos com especialistas que podem ser executados com offload para a CPU e suas licenças
Para uso sério na 9070 XT com muita RAM, aqui estão os candidatos do catálogo QualLLM na faixa de 118 a 142 bilhões de parâmetros, com a licença a ser verificada antes de qualquer uso comercial:
- Qwen 3.5 122B-A10B (Alibaba): Apache 2.0, contexto 262k, VRAM Q4 ~73 GB. Pesos publicados em a página do Hugging Face da Alibaba
- Qwen3.8 Flash Next 125B-A6B (Qwen) : licença « outra, pesos abertos », deve ser lida com atenção
- Mistral Small 4 (Mistral): Apache 2.0, contexto 256k. Pesos na a página da Mistral no Hugging Face
- Mistral Medium 3.5 128B : Modified MIT, VRAM Q4 ~74 GB. Ficha: Mistral Medium 3.5
- Nemotron 3 Super 120B (NVIDIA): NVIDIA Open Model License, VRAM Q4 ~72 GB. Pesos disponíveis em a página da NVIDIA no Hugging Face
- Laguna S 2.1 (Poolside): OpenMDW 1.1, orientado para código, VRAM Q4 ~68 GB, o mais leve do grupo
- dots.llm1 Instruct (Rednote) : MIT, VRAM Q4 ~85 GB, contexto limitado a 32k
- Mixtral 8x22B Instruct (Mistral): Apache 2.0, VRAM Q4 ~82 GB, arquitetura mais antiga
Apache 2.0 e MIT permitem uso comercial sem cláusulas especiais. As licenças « Modified MIT », « NVIDIA Open Model License » e « OpenMDW » adicionam condições que devem ser lidas no repositório do modelo antes de construir um produto com base nele. Se você tiver dúvidas entre vários candidatos, o comparador coloca duas fichas lado a lado.
Benchmarks: como interpretar os resultados para este GPU
As pontuações publicadas (MMLU para cultura geral, HumanEval e LiveCodeBench para código, GPQA para raciocínio científico) medem o modelo em precisão total, não a sua configuração. Três precauções se impõem em uma 9070 XT:
- A quantização reduz ligeiramente as pontuações : em Q4_K_M, a perda permanece geralmente inferior a 2 pontos no MMLU para modelos com mais de 12 bilhões de parâmetros, maior nos modelos menores. Número a confirmar modelo por modelo.
- As pontuações do catálogo devem ser cruzadas com oOpen LLM Leaderboard, que avalia os pesos abertos sob condições homogêneas.
- O contexto truncado altera os resultados : um modelo anunciado com 256k de contexto mas executado com 8k em 16 GB de VRAM não se comportará como nos testes longos.
O bom hábito é comparar dois modelos com suas próprias tarefas e prompts, e não se basear em um ranking agregado.
Casos de uso concretos e ferramentas compatíveis com AMD
Na 9070 XT, os usos que funcionam bem no dia a dia são o assistente de código no editor, o resumo e a reformulação de documentos, a tradução, a análise de arquivos privados em RAG local e os agentes com ferramentas em tarefas curtas. Os usos com contexto muito longo, como a análise de contratos de centenas de páginas, exigem um modelo pequeno com cache KV quantizado ou uma segunda placa.
Quanto ao software:
- Ollama suporta ROCm em RDNA 4 desde as versões de 2025; o procedimento está no guia Ollama em GPU AMD, e o projeto é acompanhado em o GitHub de Ollama
- llama.cpp oferece dois backends: ROCm (HIP) para a melhor taxa de processamento e Vulkan para a simplicidade de instalação, útil se o ROCm não reconhecer a placa
- vLLM é voltado principalmente ao serviço multiusuário; seu suporte ao ROCm está documentado em o site do vLLM mas é voltado principalmente para placas profissionais; é preciso testar esse suporte antes de contar com ele
Em caso de erro no carregamento, GPU não detectada ou mudança silenciosa para a CPU, o guia de solução de problemas com GPU no Ollama lista as causas mais frequentes. Se você planeja adicionar uma segunda placa para ultrapassar 16 GB, o guia multi-GPU llama.cpp explica a distribuição das camadas.
FAQ
P: A RX 9070 XT é uma boa escolha para um primeiro setup local de LLM?
Sim para modelos de até 24 bilhões de parâmetros em Q4, com taxas de processamento confortáveis e preço inferior ao das placas NVIDIA com VRAM equivalente. O ponto fraco continua sendo os 16 GB: compare com uma RX 7900 XTX usada com 24 GB se você quiser modelos maiores. O guia de escolha de uma GPU detalha essas escolhas e seus compromissos.
P: Qual a diferença em relação à RX 9060 XT 16 GB para LLMs?
Mesma quantidade de VRAM, portanto os mesmos modelos podem ser carregados, mas a 9060 XT tem um barramento de 128 bits e aproximadamente metade da largura de banda. A taxa de tokens por segundo segue aproximadamente essa proporção. O benchmark da 9060 XT 16 GB fornece medidas concretas para comparar com as estimativas desta página.
P: É possível rodar Qwen 3.5 122B-A10B em uma 9070 XT?
Não apenas com a VRAM: a versão Q4 ocupa aproximadamente 73 GB. Com 96 GB de RAM do sistema ou mais, o llama.cpp permite manter as camadas compartilhadas no GPU e enviar os especialistas para a RAM. A velocidade cai então para cerca de 8 a 15 tokens/s (estimativa), aceitável para uso conversacional, mas lenta para prompts longos.
P: ROCm ou Vulkan nessa placa?
O ROCm geralmente oferece uma taxa de geração 10 a 25% maior (estimativa) e um melhor processamento do prompt. O Vulkan pode ser instalado sem dependências específicas da AMD e funciona em quase todas as distribuições Linux e no Windows. Comece com o Vulkan para validar o hardware, depois passe para o ROCm se o ganho interessar a você e se a versão instalada reconhecer gfx1201.
P: Quanta RAM do sistema é preciso prever como complemento?
Para continuar usando modelos que cabem na VRAM, 32 GB são suficientes. Para usar os modelos com especialistas do catálogo com offload para a RAM do sistema, procure ter pelo menos 64 GB e, idealmente, de 96 a 128 GB de DDR5 em canal duplo. A velocidade da RAM influencia diretamente os tokens por segundo nesse modo, mais do que o próprio processador.
P: Quais modelos rodam sem GPU se a placa estiver ocupada?
Os modelos com poucos parâmetros ativos continuam utilizáveis apenas com o processador, com taxas de geração reduzidas. A página dedicada à inferência sem GPU explica as configurações de threads e de quantização que minimizam as perdas de desempenho, e o ranking Apenas CPU lista os candidatos.
Conclusão
Uma configuração de LLM com uma 9070XT é adequada para quem quer executar rapidamente um LLM local com modelos de 7 a 24 bilhões de parâmetros e continua viável para os modelos com especialistas do catálogo, desde que se invista na RAM do sistema. Os valores de taxa de processamento apresentados aqui são estimativas a confirmar em sua máquina. Para encontrar o modelo adequado aos seus 16 GB de VRAM, à sua RAM e ao seu uso, use o configurador ou navegue pelo catálogo completo filtrado por VRAM.
O hardware para rodar um LLM localmente
Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.