Desempenho de LLM em GPU AMD Radeon 9070XT

A consulta « 9070xt llm » é frequente entre os proprietários da Radeon RX 9070 XT que desejam rodar um modelo localmente sem uma placa NVIDIA. Boa notícia: com 16 GB de GDDR6 e o suporte ROCm da arquitetura RDNA 4, uma configuração 9070xt llm é viável para a maioria dos usos pessoais, desde que você entenda suas limitações de memória. Esta página detalha as especificações da placa úteis para inferência, a VRAM consumida conforme a quantização (Q4, Q5, Q8, FP16), as taxas esperadas em tokens/segundo, os modelos do catálogo QualLLM utilizáveis com transferência de parte do processamento para a CPU, a interpretação dos benchmarks e, em seguida, os casos de uso e as ferramentas (llama.cpp, Ollama, vLLM) que realmente funcionam em hardware AMD.

Ficha técnica da RX 9070 XT para inferência

O que importa para um LLM não é a potência de cálculo bruta, mas a largura de banda da memória e a quantidade de VRAM. Em relação a esses dois pontos, a placa se situa assim:

Para contextualizar: a largura de banda é similar à de uma RX 7900 XT, mas a VRAM permanece em 16 GB, contra 20 ou 24 GB da geração anterior. Essa é a contrapartida a considerar antes de comprar. A página da RX 9070 XT lista os modelos classificados por compatibilidade e o guia de instalação dedicado cobre a implementação passo a passo.

VRAM: o que cabe em 16 GB de acordo com a quantização

Regra prática para estimar a memória de um modelo denso: cerca de 0,55 a 0,6 GB por bilhão de parâmetros em Q4, 0,7 em Q5, 1,05 em Q8 e 2 em FP16, mais o cache KV que aumenta com o contexto. Em 16 GB, reservando 1 a 1,5 GB para o sistema e o cache KV:

Os modelos do catálogo de referência citado nesta página são todos muito maiores do que isso. Vejamos três exemplos da faixa de 118 a 128 bilhões de parâmetros, em que apenas os especialistas ativos trabalham a cada token:

Nenhum desses modelos cabe em 16 GB de VRAM. Eles permanecem interessantes para uma 9070 XT graças ao descarregamento dos especialistas para a RAM do sistema, explicado abaixo.

Velocidade em tokens por segundo: ordens de grandeza estimadas

Na geração, a taxa de geração de um modelo que cabe inteiramente na VRAM é limitada pela largura de banda: cada token exige ler todos os pesos. Com 640 GB/s, o limite teórico para um modelo de 8 GB em Q4 é de cerca de 80 tokens/s; na prática, observa-se entre 55 e 70% desse limite. Valores aproximados, todos estimadas e que devem ser confirmados com sua própria configuração:

Nos modelos com especialistas do catálogo, a velocidade de geração depende principalmente da RAM do sistema. Com 64 a 96 GB de DDR5 em canal duplo, as camadas de atenção na VRAM e os especialistas na RAM, pode-se esperar de 8 a 15 tokens/s (estimativa) em um modelo com 10 bilhões de parâmetros ativos como Qwen 3.5 122B-A10B, e de 12 a 20 tokens/s (estimativa) em Qwen3.8 Flash Next 125B-A6B. O processamento do prompt continua muito mais lento do que com o modelo inteiramente na VRAM. O método está documentado no GitHub do llama.cpp via as opções de posicionamento dos tensores no CPU. O comparador de benchmarks locais fornece números obtidos em outras placas para calibrar suas expectativas.

Modelos com especialistas que podem ser executados com offload para a CPU e suas licenças

Para uso sério na 9070 XT com muita RAM, aqui estão os candidatos do catálogo QualLLM na faixa de 118 a 142 bilhões de parâmetros, com a licença a ser verificada antes de qualquer uso comercial:

Apache 2.0 e MIT permitem uso comercial sem cláusulas especiais. As licenças « Modified MIT », « NVIDIA Open Model License » e « OpenMDW » adicionam condições que devem ser lidas no repositório do modelo antes de construir um produto com base nele. Se você tiver dúvidas entre vários candidatos, o comparador coloca duas fichas lado a lado.

Benchmarks: como interpretar os resultados para este GPU

As pontuações publicadas (MMLU para cultura geral, HumanEval e LiveCodeBench para código, GPQA para raciocínio científico) medem o modelo em precisão total, não a sua configuração. Três precauções se impõem em uma 9070 XT:

O bom hábito é comparar dois modelos com suas próprias tarefas e prompts, e não se basear em um ranking agregado.

Casos de uso concretos e ferramentas compatíveis com AMD

Na 9070 XT, os usos que funcionam bem no dia a dia são o assistente de código no editor, o resumo e a reformulação de documentos, a tradução, a análise de arquivos privados em RAG local e os agentes com ferramentas em tarefas curtas. Os usos com contexto muito longo, como a análise de contratos de centenas de páginas, exigem um modelo pequeno com cache KV quantizado ou uma segunda placa.

Quanto ao software:

Em caso de erro no carregamento, GPU não detectada ou mudança silenciosa para a CPU, o guia de solução de problemas com GPU no Ollama lista as causas mais frequentes. Se você planeja adicionar uma segunda placa para ultrapassar 16 GB, o guia multi-GPU llama.cpp explica a distribuição das camadas.

FAQ

P: A RX 9070 XT é uma boa escolha para um primeiro setup local de LLM?

Sim para modelos de até 24 bilhões de parâmetros em Q4, com taxas de processamento confortáveis e preço inferior ao das placas NVIDIA com VRAM equivalente. O ponto fraco continua sendo os 16 GB: compare com uma RX 7900 XTX usada com 24 GB se você quiser modelos maiores. O guia de escolha de uma GPU detalha essas escolhas e seus compromissos.

P: Qual a diferença em relação à RX 9060 XT 16 GB para LLMs?

Mesma quantidade de VRAM, portanto os mesmos modelos podem ser carregados, mas a 9060 XT tem um barramento de 128 bits e aproximadamente metade da largura de banda. A taxa de tokens por segundo segue aproximadamente essa proporção. O benchmark da 9060 XT 16 GB fornece medidas concretas para comparar com as estimativas desta página.

P: É possível rodar Qwen 3.5 122B-A10B em uma 9070 XT?

Não apenas com a VRAM: a versão Q4 ocupa aproximadamente 73 GB. Com 96 GB de RAM do sistema ou mais, o llama.cpp permite manter as camadas compartilhadas no GPU e enviar os especialistas para a RAM. A velocidade cai então para cerca de 8 a 15 tokens/s (estimativa), aceitável para uso conversacional, mas lenta para prompts longos.

P: ROCm ou Vulkan nessa placa?

O ROCm geralmente oferece uma taxa de geração 10 a 25% maior (estimativa) e um melhor processamento do prompt. O Vulkan pode ser instalado sem dependências específicas da AMD e funciona em quase todas as distribuições Linux e no Windows. Comece com o Vulkan para validar o hardware, depois passe para o ROCm se o ganho interessar a você e se a versão instalada reconhecer gfx1201.

P: Quanta RAM do sistema é preciso prever como complemento?

Para continuar usando modelos que cabem na VRAM, 32 GB são suficientes. Para usar os modelos com especialistas do catálogo com offload para a RAM do sistema, procure ter pelo menos 64 GB e, idealmente, de 96 a 128 GB de DDR5 em canal duplo. A velocidade da RAM influencia diretamente os tokens por segundo nesse modo, mais do que o próprio processador.

P: Quais modelos rodam sem GPU se a placa estiver ocupada?

Os modelos com poucos parâmetros ativos continuam utilizáveis apenas com o processador, com taxas de geração reduzidas. A página dedicada à inferência sem GPU explica as configurações de threads e de quantização que minimizam as perdas de desempenho, e o ranking Apenas CPU lista os candidatos.

Conclusão

Uma configuração de LLM com uma 9070XT é adequada para quem quer executar rapidamente um LLM local com modelos de 7 a 24 bilhões de parâmetros e continua viável para os modelos com especialistas do catálogo, desde que se invista na RAM do sistema. Os valores de taxa de processamento apresentados aqui são estimativas a confirmar em sua máquina. Para encontrar o modelo adequado aos seus 16 GB de VRAM, à sua RAM e ao seu uso, use o configurador ou navegue pelo catálogo completo filtrado por VRAM.

O hardware para rodar um LLM localmente

Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:

Amazon RTX 5070 Ti →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.