Início › Catálogo › Melhor LLM na Radeon RX 7900 XTX (24 GB) em 2026

Melhor LLM na Radeon RX 7900 XTX (24 GB) em 2026

◆ IA Local — Seu ChatGPT privado e gratuito, na sua máquina, em 1 h · 24 € · ou todos os kits por 49 € →

Classificação atualizada em 09/10/2026

A Radeon RX 7900 XTX (24 GB GDDR6, 960 GB/s) é a alternativa da AMD à RTX 4090. 24 GB + largura de banda semelhante = mesmas capacidades de VRAM. Compatível com ROCm 6 + llama.cpp/Ollama.

Ofertas e alternativas para IA local

Radeon RX 7900 XTX: opção de compra disponível para IA local — Radeon RX 9070 XT 16 GB:

Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →

Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Classificação

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26 bilhões de parâmetros · Apache 2.0 · 128 000 tokens ctx

Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).

Por que esta posição Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Na Radeon RX 7900 XTX
Q5_K_M
19 GB · 22 tok/s
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 bilhões de parâmetros · Apache 2.0 · 8 192 tokens ctx

Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.

Por que esta posição Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.
# HuggingFace: inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Na Radeon RX 7900 XTX
Q5_K_M
22 GB · 60 tok/s
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27B de parâmetros · Apache 2.0 · 262 144 tokens ctx

Denso 27B multimodal, lançado em 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por que esta posição Denso 27B multimodal, lançado em 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Na Radeon RX 7900 XTX
Q5_K_M
19 GB · 13 tok/s
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27B de parâmetros · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: modelo denso multimodal (texto + visão), contexto de 262k, cerca de 16 GB de VRAM em Q4 (18 GB de pesos no Ollama). Apache 2.0, programação agêntica e visão.

Por que esta posição Qwen 3.8 27B: modelo denso multimodal (texto + visão), contexto de 262k, cerca de 16 GB de VRAM em Q4 (18 GB de pesos no Ollama). Apache 2.0, programação agêntica e visão.
ollama run qwen3.8:27b
Na Radeon RX 7900 XTX
Q5_K_M
19 GB · 14 tok/s
5

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B de parâmetros · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.

Por que esta posição GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
Na Radeon RX 7900 XTX
Q5_K_M
23 GB · 40 tok/s
6

🇺🇸 Gemma 4 31B

Google · 31B de parâmetros · Apache 2.0 · 256 000 tokens ctx

Denso 31B multimodal (texto+imagem+áudio). 140+ idiomas, 256k ctx. Nº 3 entre os modelos abertos no Chatbot Arena.

Por que esta posição Denso 31B multimodal (texto+imagem+áudio). 140+ idiomas, 256k ctx. Nº 3 entre os modelos abertos no Chatbot Arena.
ollama run gemma4:31b
Na Radeon RX 7900 XTX
Q5_K_M
22 GB · 12 tok/s
7

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B de parâmetros · Apache 2.0 · 131 072 tokens ctx

Modelo denso de 30B, Apache 2.0, 12 idiomas incluindo francês, 131k de contexto, GQA 32Q/8KV. Chamada de ferramentas compatível com OpenAI. Lançamento em 29 de abril de 2026.

Por que esta posição Modelo denso de 30B, Apache 2.0, 12 idiomas incluindo francês, 131k de contexto, GQA 32Q/8KV. Chamada de ferramentas compatível com OpenAI. Lançamento em 29 de abril de 2026.
ollama run granite4.1:30b
Na Radeon RX 7900 XTX
Q5_K_M
21 GB · 12 tok/s
8

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B de parâmetros · NVIDIA Open Model License · 128 000 tokens ctx

MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.

Por que esta posição MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.
ollama run nemotron-cascade-2
Na Radeon RX 7900 XTX
Q5_K_M
21 GB · 30 tok/s

Tabela comparativa

Posição Modelo Params VRAM Q4 Contexto Licença Na Radeon RX 7900 XTX
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 tok/s · Q5_K_M
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 tok/s · Q5_K_M
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 tok/s · Q5_K_M
#5 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q5_K_M
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q5_K_M
#7 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 30 tok/s · Q5_K_M
O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Memo gratuito

Qual modelo de código rodar na SUA máquina?

Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.

O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →

Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).

Metodologia do ranking

Filtro: Q4_K_M ≤ 22 GB. Bônus 13-32B (pico de 24 GB). 960 GB/s GDDR6 + ROCm 6 maduro.

Critérios considerados:

  • Q4_K_M ≤ 22 GB
  • Compatível com ROCm 6
  • Qwen 3 32B Q5 rodando com fluidez
  • 24 GB pelo preço de uma 4070 Ti Super

A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.

Perguntas frequentes

RX 7900 XTX vs RTX 4090?

Os mesmos 24 GB. 7900 XTX 960 GB/s vs 4090 1008 GB/s = largura de banda quase idêntica. Mas CUDA continua com melhor suporte (Ollama, vLLM, ExLlamaV2). A 4090 é ~30-50 % mais rápida na prática. Veja RTX 4090.

O ROCm é confiável em 2026?

Sim, ROCm 6 estável + Ollama oferece suporte nativo a AMD. llama.cpp + ROCm funciona bem. O vLLM para AMD está avançando, mas ainda é menos maduro que CUDA. Para Ollama/chat, funciona bem. Veja guide.

Preço RX 7900 XTX em 2026?

~750-900 € nova, ~600-700 € usada. Excelente relação €/GB de VRAM em comparação com uma RTX 4090 nova (~1500 €) ou uma RTX 3090 usada (~650 €).

Llama 70B na 7900 XTX?

Q4 (~40 GB) não cabe. Q3 (~32 GB) não cabe. Q2 (~24 GB) cabe por pouco, mas com qualidade reduzida. Para executar um modelo de 70B com fluidez, optar por 2× 7900 XTX ou um Mac Studio. Ver Mac Studio.

Para se aprofundar

Os kits QuelLLM O guia de referência por uso
Todos os kits com acesso vitalício — 49 €