🇺🇸 Gemma 4 26B-A4B MoE
Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Classificação atualizada em 09/10/2026
A Radeon RX 7900 XTX (24 GB GDDR6, 960 GB/s) é a alternativa da AMD à RTX 4090. 24 GB + largura de banda semelhante = mesmas capacidades de VRAM. Compatível com ROCm 6 + llama.cpp/Ollama.
Radeon RX 7900 XTX: opção de compra disponível para IA local — Radeon RX 9070 XT 16 GB:
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.
# HuggingFace: inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Denso 27B multimodal, lançado em 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modelo denso multimodal (texto + visão), contexto de 262k, cerca de 16 GB de VRAM em Q4 (18 GB de pesos no Ollama). Apache 2.0, programação agêntica e visão.
ollama run qwen3.8:27b
GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
Denso 31B multimodal (texto+imagem+áudio). 140+ idiomas, 256k ctx. Nº 3 entre os modelos abertos no Chatbot Arena.
ollama run gemma4:31b
Modelo denso de 30B, Apache 2.0, 12 idiomas incluindo francês, 131k de contexto, GQA 32Q/8KV. Chamada de ferramentas compatível com OpenAI. Lançamento em 29 de abril de 2026.
ollama run granite4.1:30b
MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.
ollama run nemotron-cascade-2
| Posição | Modelo | Params | VRAM Q4 | Contexto | Licença | Na Radeon RX 7900 XTX |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q5_K_M |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q5_K_M |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q5_K_M |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q5_K_M |
| #5 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q5_K_M |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #7 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #8 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q5_K_M |
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
Memo gratuito
Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.
O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).
Sua placa → o melhor modelo para programação para rodar localmente e o comando Ollama exato:
| Sua VRAM | GPU / Mac típicos | Modelo de código recomendado | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) ou Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista em agentes de código | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — o “quase Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base: ollama run qwen2.5-coder:7b-base — ainda é a referência neste caso específico. ⚠️ Qwen 3.8: seu nível de raciocínio é definido como muito alto por padrão e ele “pensa demais” em solicitações simples — reduza-o para low (ou desative-o) na primeira execução. ⚠️ Armadilha de licença: Codestral 22B = Mistral Non-Production License → proibido para programar no trabalho. Qwen 3.5/3.8, Gemma 4 e Devstral são disponibilizados sob a licença Apache 2.0. 💡 Está travando por falta de memória? Mantenha ~1,5 GB de VRAM livre para o contexto, ou passe para um nível menor de quantização.🔌 Para conectá-lo no VS Code: Cline (agente que trabalha com vários arquivos), Aider (CLI) ou Tabby/Twinny (autocompletação FIM) — todos se conectam ao Ollama localmente. O kit Copiloto Local — configs prontas para colar + setup testado — está disponível: /copilote-local.
Filtro: Q4_K_M ≤ 22 GB. Bônus 13-32B (pico de 24 GB). 960 GB/s GDDR6 + ROCm 6 maduro.
Critérios considerados:
A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.
RX 7900 XTX vs RTX 4090?
Os mesmos 24 GB. 7900 XTX 960 GB/s vs 4090 1008 GB/s = largura de banda quase idêntica. Mas CUDA continua com melhor suporte (Ollama, vLLM, ExLlamaV2). A 4090 é ~30-50 % mais rápida na prática. Veja RTX 4090.
O ROCm é confiável em 2026?
Sim, ROCm 6 estável + Ollama oferece suporte nativo a AMD. llama.cpp + ROCm funciona bem. O vLLM para AMD está avançando, mas ainda é menos maduro que CUDA. Para Ollama/chat, funciona bem. Veja guide.
Preço RX 7900 XTX em 2026?
~750-900 € nova, ~600-700 € usada. Excelente relação €/GB de VRAM em comparação com uma RTX 4090 nova (~1500 €) ou uma RTX 3090 usada (~650 €).
Llama 70B na 7900 XTX?
Q4 (~40 GB) não cabe. Q3 (~32 GB) não cabe. Q2 (~24 GB) cabe por pouco, mas com qualidade reduzida. Para executar um modelo de 70B com fluidez, optar por 2× 7900 XTX ou um Mac Studio. Ver Mac Studio.