Início › Catálogo › Melhor LLM para a RTX 3090 Ti (24 GB) em 2026

Melhor LLM para a RTX 3090 Ti (24 GB) em 2026

◆ IA Local — Seu ChatGPT privado e gratuito, na sua máquina, em 1 h · 24 € · ou todos os kits por 49 € →

Classificação atualizada em 09/10/2026

A RTX 3090 Ti (24 GB GDDR6X, 1008 GB/s) é o modelo topo de linha da arquitetura Ampere. 24 GB + 1 TB/s de largura de banda = mesmas capacidades de VRAM que uma 4090 por 60% do preço de uma nova, ~700 € no mercado de usados.

Ofertas e alternativas para IA local

RTX 3090 Ti: opção de compra disponível para IA local — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395):

Um mini-PC é uma máquina completa: verifique a memória necessária e a compatibilidade do software. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Qual PC escolher conforme seu orçamento? Nossas escolhas de 800 a 3 500 € →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você, o que não influencia a classificação (estabelecida de forma independente). Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Classificação

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26 bilhões de parâmetros · Apache 2.0 · 128 000 tokens ctx

Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).

Por que esta posição Variante MoE de Gemma 4. 26B/4B ativos. Multimodal completo (texto+imagem+áudio).
ollama run gemma4:26b
Na RTX 3090 Ti
Q5_K_M
19 GB · 22 tok/s
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 bilhões de parâmetros · Apache 2.0 · 8 192 tokens ctx

Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.

Por que esta posição Primeiro dLLM aberto sob a licença Apache 2.0: MoE 16B/1B + decodificador de difusão 6.2B. Texto+visão unificados. Lançamento em 22 de abril de 2026.
# HuggingFace: inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Na RTX 3090 Ti
Q5_K_M
22 GB · 60 tok/s
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27B de parâmetros · Apache 2.0 · 262 144 tokens ctx

Denso 27B multimodal, lançado em 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por que esta posição Denso 27B multimodal, lançado em 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Na RTX 3090 Ti
Q5_K_M
19 GB · 13 tok/s
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27B de parâmetros · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: modelo denso multimodal (texto + visão), contexto de 262k, cerca de 16 GB de VRAM em Q4 (18 GB de pesos no Ollama). Apache 2.0, programação agêntica e visão.

Por que esta posição Qwen 3.8 27B: modelo denso multimodal (texto + visão), contexto de 262k, cerca de 16 GB de VRAM em Q4 (18 GB de pesos no Ollama). Apache 2.0, programação agêntica e visão.
ollama run qwen3.8:27b
Na RTX 3090 Ti
Q5_K_M
19 GB · 14 tok/s
5

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B de parâmetros · MIT · 128 000 tokens ctx

GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.

Por que esta posição GLM-4.7-Flash (MoE 31B, ~3B ativos): a melhor relação entre desempenho em programação e VRAM da classe 30B. MIT, 128k ctx, muito rápido em 3090/4090.
ollama run glm-4.7-flash
Na RTX 3090 Ti
Q5_K_M
23 GB · 40 tok/s
6

🇺🇸 Gemma 4 31B

Google · 31B de parâmetros · Apache 2.0 · 256 000 tokens ctx

Denso 31B multimodal (texto+imagem+áudio). 140+ idiomas, 256k ctx. Nº 3 entre os modelos abertos no Chatbot Arena.

Por que esta posição Denso 31B multimodal (texto+imagem+áudio). 140+ idiomas, 256k ctx. Nº 3 entre os modelos abertos no Chatbot Arena.
ollama run gemma4:31b
Na RTX 3090 Ti
Q5_K_M
22 GB · 12 tok/s
7

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B de parâmetros · Apache 2.0 · 131 072 tokens ctx

Modelo denso de 30B, Apache 2.0, 12 idiomas incluindo francês, 131k de contexto, GQA 32Q/8KV. Chamada de ferramentas compatível com OpenAI. Lançamento em 29 de abril de 2026.

Por que esta posição Modelo denso de 30B, Apache 2.0, 12 idiomas incluindo francês, 131k de contexto, GQA 32Q/8KV. Chamada de ferramentas compatível com OpenAI. Lançamento em 29 de abril de 2026.
ollama run granite4.1:30b
Na RTX 3090 Ti
Q5_K_M
21 GB · 12 tok/s
8

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B de parâmetros · NVIDIA Open Model License · 128 000 tokens ctx

MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.

Por que esta posição MoE 30B/3B ativos: thinking mode + instruct. Medalha de ouro na IMO 2025 e na IOI 2025. Inferência rápida graças aos 3B ativos, capacidades de raciocínio de nível 30B. Lançamento em abril de 2026.
ollama run nemotron-cascade-2
Na RTX 3090 Ti
Q5_K_M
21 GB · 30 tok/s

Tabela comparativa

Posição Modelo Params VRAM Q4 Contexto Licença Na RTX 3090 Ti
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 tok/s · Q5_K_M
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 tok/s · Q5_K_M
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 tok/s · Q5_K_M
#5 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q5_K_M
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q5_K_M
#7 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA Open Model License 30 tok/s · Q5_K_M
O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Memo gratuito

Qual modelo de código rodar na SUA máquina?

Receba o resumo VRAM → melhor modelo de código → comando Ollama (uma única tela, copiar e colar). E passe para o kit Copiloto Local para transformar isso em uma configuração que realmente funciona.

O kit Copiloto Local — as configs Ollama + Cline + Aider prontas para colar, Modelfiles ajustados, solução de problemas, espaço online vitalício →

Sem spam. Cancelamento em 1 clique. Seus dados ficam conosco (nunca revendidos).

Metodologia do ranking

Filtro: Q4_K_M ≤ 22 GB. Bônus 13-32B (pico de 24 GB) e 7-32B. Largura de banda de 1008 GB/s, recorde na arquitetura Ampere.

Critérios considerados:

  • Q4_K_M ≤ 22 GB
  • Qwen 3 32B Q5 com folga
  • Fine-tuning LoRA 7-13B
  • 24 GB + 1 TB/s

A pontuação é totalmente transparente: consulte nossa metodologia para os detalhes de cálculo de VRAM/tokens/seg.

Perguntas frequentes

RTX 3090 Ti vs. 3090?

Os mesmos 24 GB. 3090 Ti = +7% de núcleos CUDA + GDDR6X 1008 GB/s versus 3090 com GDDR6X 936 GB/s. Diferença de ~5-8% para LLM. A 3090 costuma oferecer melhor custo-benefício no mercado de usados. Veja RTX 3090.

3090 Ti vs. 4090?

Os mesmos 24 GB. A 4090 também tem 1008 GB/s + 16384 núcleos CUDA, contra 10752 na 3090 Ti. ~40-50% mais rápida para LLMs. Se for comprar nova, 4090. No mercado de usados, ~700 € contra ~1100 €: a 3090 Ti é excelente. Veja RTX 4090.

Llama 70B em uma 3090 Ti?

Q3_K_M (~32 GB) não cabe em uma única placa. Q2_K (~24 GB) cabe no limite, mas com qualidade degradada. Para rodar 70B com folga, 2× 3090 Ti ou RTX 5090 de 32 GB. Veja RTX 5090.

Configuração com 2× 3090 Ti usadas?

Excelente: 48 GB de VRAM distribuídos entre as placas por ~1400 € no total. O Llama 70B Q4 (~40 GB) cabe e roda a ~30 tok/s via paralelismo tensorial. Difícil de superar em relação custo-benefício para LLMs em 2026.

Para se aprofundar

Os kits QuelLLM O guia de referência por uso
Todos os kits com acesso vitalício — 49 €