Melhor LLM para Radeon RX 9070 XT (16 GB) em 2026
Identificar o melhor LLM para a RX 9070 XT exige compreender duas restrições interligadas: 16 GB de VRAM GDDR6 e o ecossistema ROCm da AMD, agora funcional na arquitetura RDNA4. A RX 9070 XT representa, em 2026, o ponto de entrada mais acessível para executar modelos com 27 bilhões de parâmetros em quantização Q4 em GPUs voltadas ao consumidor, no Linux ou no Windows. Este guia analisa as especificações de hardware, seleciona os modelos do catálogo QualLLM adequados para essa placa, compara as licenças, fornece referências de velocidade e apresenta recomendações por caso de uso.
RX 9070 XT e ROCm: o que você precisa saber antes de escolher um modelo
A Radeon RX 9070 XT possui 16 GB de memória GDDR6 em um barramento de 256 bits, proporcionando uma largura de banda teórica de cerca de 576 GB/s. A arquitetura RDNA4 é suportada desde ROCm 6.x, o que permite usar o llama.cpp compilado com o backend HIP, Ollama ≥ 0.3.x ou LM Studio — desde que tenha os drivers amdgpu recentes no Linux, ou uma instalação do ROCm no Windows.
Pontos-chave antes de executar um modelo:
- VRAM utilizável : ~15,5 GB na prática, descontando o consumo adicional do sistema e dos drivers
- Largura de banda : ~576 GB/s (estimado), contra ~1 008 GB/s para uma RTX 4090 — a velocidade de inferência é proporcionalmente reduzida
- backend mais estável : llama.cpp com
-DGGML_HIPBLAS=ONno Linux - Compatibilidade : verificar a matriz de compatibilidade AMD para as versões exatas do seu kernel e do seu driver
- Precisão nativa : Suporte a FP16 nas unidades de cálculo RDNA4
A boa notícia: os modelos em torno de 27B com quantização Q4 são perfeitamente adequados para 16 GB, e a família dos 24B oferece uma margem confortável para contextos longos.
Quais modelos cabem em 16 GB de VRAM?
A regra aproximada para Q4 é de cerca de 0,55 GB por bilhão de parâmetros. Um modelo de 27B pesa então ~15-16 GB em Q4, um de 24B ~13-14 GB e um de 32B ~18-19 GB — fora do limite.
Modelos 26-27B compatíveis com Q4 nativos (≤ 16 GB)
- Gemma 2 27B — VRAM Q4 : ~16 GB, ctx : 8 192
- Gemma 3 27B — VRAM Q4 : ~16 GB, ctx : 128 000
- Qwen 3.5 27B — VRAM Q4 : ~16 GB, ctx : 262 000
- Qwen 3.6 27B — VRAM Q4 : ~16 GB, ctx : 262 144
- Qwen 3.8 27B — VRAM Q4 : ~16 GB, ctx : 262 144
- Gemma 4 26B-A4B MoE — VRAM Q4 : ~16 GB, ctx : 128.000, arquitetura mixture-of-experts
- Trinity Mini 26B-A3B — VRAM Q4 : ~15 GB, ctx : 131 072
Modelos 24B (margem confortável, 2 a 3 GB livres)
- Mistral Small 3.2 24B — VRAM Q4 : ~14 GB
- Magistral Small 24B — VRAM Q4 : ~14 GB
- Devstral Small 2 24B — VRAM Q4 : ~14 GB, ctx : 256 000
Modelos de 20–22B (boa margem, ~3–5 GB livres)
- Codestral 22B v0.1 — VRAM Q4 : ~13 GB, ctx : 32 000
- EuroLLM 22B Instruct 2512 — VRAM Q4 : ~13 GB, multilíngue europeu
- gpt-oss 20B — VRAM Q4 : ~13 GB, ctx : 128 000
Observação sobre os 32B : em Q4 (~19 GB), eles ultrapassam os 16 GB disponíveis. Em Q3 (~13-14 GB, ou seja, ~0,42 GB/B), é tecnicamente possível com perda de precisão mensurável. Na 9070 XT, manter os 27B em Q4 continua a escolha mais racional.
Top 5 dos modelos recomendados para a RX 9070 XT
1. Qwen 3.8 27B — versatilidade e contexto longo
Qwen 3.8 27B é a versão mais avançada da série Qwen 3.x na faixa de 27B, publicada pela Alibaba sob licença Apache 2.0. Seu contexto de 262.144 tokens é um dos mais amplos disponíveis nessa faixa de tamanho. Ocupa integralmente os 16 GB em Q4 sem exceder essa capacidade.
- Licença : Apache 2.0 (uso comercial autorizado)
- VRAM Q4 : ~16 GB
- Contexto : 262 144 tokens
- Pontos fortes : raciocínio geral, código, perguntas de longa distância
- Velocidade estimada : 20-30 tokens/s na RX 9070 XT (estimado com base em benchmark da comunidade, proporcional à largura de banda)
2. Gemma 3 27B — desempenho validado, contexto 128 k
Gemma 3 27B do Google oferece 128.000 tokens de contexto e uma arquitetura bem documentada. Seu desempenho no Open LLM Leaderboard do Hugging Face o colocam entre as referências na categoria 27B para compreensão e seguimento de instruções.
- Licença : Gemma (restrições para certos usos comerciais — ver os termos de uso do Google)
- VRAM Q4 : ~16 GB
- Contexto : 128 000 tokens
- Pontos fortes : compreensão de relações a longa distância, cumprimento preciso de instruções
3. Magistral Small 24B — raciocínio estruturado
Magistral Small 24B da Mistral AI foi projetado para tarefas de raciocínio em múltiplas etapas e análise estruturada. Com ~14 GB em Q4, ele deixa 2 GB de margem na 9070 XT — útil para manter um contexto de sistema ampliado em produção.
- Licença : Apache 2.0
- VRAM Q4 : ~14 GB
- Contexto : 128 000 tokens
- Pontos fortes : análise, resumo estruturado, agente com execução em etapas, raciocínio em cadeia
4. Devstral Small 2 24B — agente de desenvolvimento de software
Devstral Small 2 24B (Apache 2.0, Mistral AI) visa explicitamente agentes de desenvolvimento com um contexto excepcional de 256.000 tokens. Ele pode ingerir uma base de código inteira em uma única passagem, o que o torna relevante para revisão automatizada, geração de testes ou documentação.
- Licença : Apache 2.0
- VRAM Q4 : ~14 GB
- Contexto : 256 000 tokens
- Pontos fortes : geração de código, refatoração, leitura de uma grande base de código
5. Codestral 22B v0.1 — especialista em código, leve
Codestral 22B v0.1 da Mistral AI é uma das referências na categoria de modelos para código com menos de 23B. Ele suporta o fill-in-the-middle (FIM) e alcança pontuações no HumanEval superiores às dos modelos generalistas de mesmo tamanho (pontuações exatas em GGUF Q4: a confirmar). Ele ocupa apenas ~13 GB em Q4.
- Licença : Mistral Non-Production License (uso exclusivamente não comercial)
- VRAM Q4 : ~13 GB
- Contexto : 32 000 tokens
- Pontos fortes : conclusão de código, FIM, integração com IDE
Licenças: Apache 2.0, MIT, Gemma — o que muda conforme o uso
A escolha da licença condiciona o uso em empresas ou em um produto.
Licenças livres para uso comercial (Apache 2.0 ou MIT)
- Qwen 3.5 27B, Qwen 3.6 27B, Qwen 3.8 27B — Apache 2.0
- Trinity Mini 26B-A3B — Apache 2.0
- Magistral Small 24B, Devstral Small 2 24B, Mistral Small 3.2 24B — Apache 2.0
- EuroLLM 22B Instruct 2512, gpt-oss 20B — Apache 2.0
- Phi-4 14B — MIT
Licenças restritas
- Licença Gemma (Gemma 2 27B, Gemma 3 27B, Gemma 4 26B-A4B MoE): exige a aceitação das termos de uso Google Gemma ; alguns usos comerciais estão sujeitos a restrições
- Mistral Non-Production License : Codestral 22B está reservado para contextos não comerciais e de pesquisa
Para uma visão resumida das licenças disponíveis no catálogo, consultar o guia das licenças de LLMs com pesos abertos.
Benchmarks e desempenho esperado na RX 9070 XT
As pontuações abaixo vêm de publicações oficiais ou de benchmarks da comunidade. As velocidades de inferência na RX 9070 XT são estimadas a partir de medições em outros GPUs ponderadas pela largura de banda de memória respectiva.
MMLU — avaliação geral
- Série Qwen 3.x 27B: desempenho no MMLU acima de 75% em 5-shot relatado na página Qwen do HuggingFace para as variantes deste tamanho (a confirmar em Q4)
- Gemma 3 27B: resultados publicados pelo Google na documentação oficial do Gemma — verificar a degradação em Q4 conforme o nível de quantização
- Magistral Small 24B : métricas de raciocínio publicadas por Mistral AI nas notas de versão
HumanEval — geração de código
- Devstral Small 2 24B: projetado para agentes de programação, pontuação no HumanEval superior à dos modelos generalistas do mesmo tamanho (a confirmar no GGUF Q4)
- Codestral 22B: referência na categoria de modelos para código com menos de 23B, segundo os benchmarks da comunidade relatados em r/LocalLLaMA
Velocidade de inferência (estimada)
- Modelos de 27B em Q4: 20-35 tokens/s na RX 9070 XT
- Modelos 24B Q4: 35-50 tokens/s
- Modelos 14-22B Q4: 50-80 tokens/s
Essas faixas dependem do backend (llama.cpp HIP vs ROCm nativo), do nível de paralelismo e do comprimento do contexto ativo. Com um contexto próximo ao máximo (262 k tokens), a velocidade cai significativamente.
Casos de uso concretos
Desenvolvimento de software e revisão de código Devstral Small 2 24B para agentes que trabalham com vários arquivos e projetos de grande porte; Codestral 22B para a complementação de código e o FIM em um IDE. Ambos rodam com folga na 9070 XT.
Análise de documentos longos Qwen 3.8 27B com seus 262.144 tokens de contexto permite analisar contratos ou relatórios volumosos em uma única requisição. Gemma 3 27B (128 000 tokens) é uma alternativa sólida sob licença Gemma.
Multilinguismo e francês EuroLLM 22B Instruct 2512 é treinado especificamente em línguas europeias, incluindo o francês, o alemão e o espanhol. É executado com cerca de 3 GB de margem na 9070 XT.
Modelo rápido e leve Phi-4 14B (MIT, Microsoft) ocupa ~9 GB em Q4 e libera 7 GB para um contexto muito amplo ou sessões simultâneas. Pertinente quando a velocidade é prioridade em relação ao tamanho do modelo.
Raciocínio e agentes Magistral Small 24B para cadeias de raciocínio estruturadas e agentes simples. Trinity Mini 26B-A3B (Apache 2.0, Arcee AI) com ~15 GB em Q4 oferece um bom equilíbrio entre raciocínio e tamanho.
Para comparar dois modelos diretamente, utilizar o comparador QualLLM.
FAQ
P: A RX 9070 XT é bem suportada pelo ROCm?
ROCm 6.x inclui suporte para a arquitetura RDNA4 (navi48). No Linux com os drivers amdgpu-dkms recentes, o llama.cpp HIP funciona de forma estável. No Windows, o ROCm for Windows ainda está amadurecendo — consultar a matriz de compatibilidade AMD antes de qualquer configuração. O desempenho no Linux geralmente é melhor do que no ambiente Windows, por enquanto.
P: É possível rodar um modelo de 32B na RX 9070 XT com 16 GB?
Em Q4 (~19 GB para um 32B), não — a capacidade da VRAM é excedida. Em Q3 (~13-14 GB), é possível com uma perda significativa de precisão. Na prática, os modelos 27B em Q4 oferecem uma melhor relação qualidade/tamanho nessa placa: mesmo nível de inferência, precisão plena de Q4 e sem risco de exceder a capacidade da memória.
P: Qual quantização escolher entre Q4, Q5 e Q8?
Q4_K_M é o melhor ponto de partida: perda de qualidade baixa, tamanho reduzido à metade em relação ao FP16. Q5_K_M melhora a precisão com cerca de +25% de VRAM. Q8_0 está próximo do FP16, mas ultrapassa 16 GB para a maioria dos 27B. Na 9070 XT, Q4_K_M em 27B ou Q5_K_M em 24B são opções razoáveis. FP16 completo em 27B (~30 GB) está fora de alcance.
P: Ollama funciona na RX 9070 XT sob Linux?
Sim. Ollama ≥ 0.3.x detecta automaticamente GPUs AMD compatíveis com ROCm no Linux, desde que os drivers amdgpu-dkms estejam corretamente instalados. Nenhuma configuração manual é necessária na maioria dos casos. No Windows, o suporte depende da versão de ROCm for Windows disponível no momento da instalação.
P: Qual modelo você recomenda para o francês do dia a dia?
EuroLLM 22B Instruct 2512 é o mais voltado às línguas europeias. Mistral Small 3.2 24B da Mistral AI (Apache 2.0) oferece excelente desempenho em francês para tarefas gerais e redação assistida, com boa margem na 9070 XT.
P: Qwen 3.8 27B ou Gemma 3 27B : qual é a melhor escolha?
Os dois ocupam ~16 GB em Q4. Qwen 3.8 27B está sob a licença Apache 2.0 (uso comercial livre) e oferece um contexto mais amplo (262.144 versus 128.000 tokens). Gemma 3 27B está sujeito à licença Gemma, mais restritiva para uso comercial. Se a licença for neutra, os scores respectivos no Open LLM Leaderboard permitem decidir de acordo com sua tarefa específica.
Conclusão
Le melhor LLM para a RX 9070 XT em 2026 está na faixa de 24-27B: Qwen 3.8 27B e Gemma 3 27B para versatilidade geral, Devstral Small 2 24B e Codestral 22B para desenvolvimento de software, EuroLLM 22B para multilinguismo europeu, Magistral Small 24B para raciocínio estruturado. Com 16 GB de VRAM RDNA4 e ROCm, esta placa permite alcançar um nível sólido de desempenho em auto-hospedagem. Explore o catálogo completo de QualLLM ou use o configurador para refinar sua seleção de acordo com sua GPU, a licença desejada e seu caso de uso.
O hardware para rodar um LLM localmente
Para executar esses modelos localmente com conforto, uma Radeon RX 9070 XT oferece uma excelente relação preço/desempenho. Compare os preços:
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.