🇨🇳 LLaDA 2.0 Uni 16B
Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Classificação atualizada em 09/10/2026
A Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s) é a irmã mais nova da 7900 XTX. Seus incomuns 20 GB permitem rodar modelos de 24–32B em Q4 com folga. ~650 € nova, excelente custo-benefício.
Radeon RX 7900 XT : opção de compra disponível para IA local — Radeon RX 9070 XT 16 GB :
Por que essa escolha? Nossa ficha completa sobre Radeon RX 9070 XT 16 GB →
Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Especialista em programação, 24B, Apache 2.0. 72,2% no SWE-Bench. 256k ctx, laboratório francês.
ollama run devstral-small2:24b
Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Denso 27B multimodal, lançado em 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modelo denso multimodal (texto + visão), contexto de 262k, cerca de 16 GB de VRAM em Q4 (18 GB de pesos no Ollama). Apache 2.0, programação agêntica e visão.
ollama run qwen3.8:27b
Primeiro modelo de raciocínio aberto da Mistral. AIME24 70,7%. Base Small 3.1 + treinamento CoT.
ollama run magistral:24b
Denso 31B multimodal (texto+imagem+áudio). 140+ idiomas, 256k ctx. Nº 3 entre os modelos abertos no Chatbot Arena.
ollama run gemma4:31b
| Posição | Modelo | Params | VRAM Q4 | Contexto | Licença | Na Radeon RX 7900 XT |
|---|---|---|---|---|---|---|
| #1 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q4_K_M |
| #2 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 | 15 tok/s · Q5_K_M |
| #3 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q5_K_M |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q5_K_M |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q5_K_M |
| #6 | Magistral Small 24B | 24B | 14 GB | 128 000 | Apache 2.0 | 15 tok/s · Q5_K_M |
| #7 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | 12 tok/s · Q4_K_M |
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
Memo gratuito
Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.
O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).
Sua placa → o melhor modelo para programação para rodar localmente e o comando Ollama exato:
| Sua VRAM | GPU / Mac típicos | Modelo de código recomendado | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) ou Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — especialista em agentes de código | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — o “quase Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE rápido | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — ainda é a referência neste caso específico. ⚠️ Qwen 3.8: seu nível de raciocínio é definido como muito alto por padrão e ele “pensa demais” em solicitações simples — reduza-o para low (ou desative-o) na primeira execução. ⚠️ Armadilha de licença: Codestral 22B = Mistral Non-Production License → proibido para programar no trabalho. Qwen 3.5/3.8, Gemma 4 e Devstral são disponibilizados sob a licença Apache 2.0. 💡 Está travando por falta de memória? Mantenha ~1,5 GB de VRAM livre para o contexto, ou passe para um nível menor de quantização.🔌 Para conectá-lo no VS Code: Cline (agente que trabalha com vários arquivos), Aider (CLI) ou Tabby/Twinny (autocompletação FIM) — todos se conectam ao Ollama localmente. O kit Copiloto Local — configs prontas para colar + setup testado — está disponível: /copilote-local.
Filtro: Q4_K_M ≤ 18 GB. Bônus 13-32B (pico 20 GB). 800 GB/s + ROCm 6.
Critérios considerados:
A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.
RX 7900 XT versus 7900 XTX?
XT = 20 GB + 800 GB/s. XTX = 24 GB + 960 GB/s. Para modelos 24-32B Q4, os dois são adequados. XTX preferível para fine-tuning ou 32B Q5. Veja RX 7900 XTX.
Por que 20 GB e não 16 ou 24?
Escolha de marketing da AMD para posicionar entre a 7900 XTX e a faixa anterior. Para LLM, é o ponto ideal: Mistral Small 24B Q4 (~13 GB) + contexto 32k + cache = ~18 GB.
ROCm na 7900 XT: fácil?
Sim desde o ROCm 6 (2024). Ollama suporta nativamente via -gpu rocm. llama.cpp também. Mais simples do que há 2 anos. Veja guide.
Qual é o ponto ideal para LLMs na 7900 XT?
Mistral Small 24B Q5 (~17 GB) a 25 tok/s, Qwen 3 32B Q4 (~17 GB) a 22 tok/s. Excelente para código + conversa.