Qual LLM na RTX 5070 (12 GB) ?
A RTX 5070 possui 12 GB de GDDR7 a 672 GB/s: ela carrega na VRAM todos os modelos de até cerca de 10 GB, incluindo Qwen 3.5 9B (6,6 GB) e Gemma 4 12B (7,7 a 8 GB), com uma margem efetiva para o contexto. Ela não carrega Mistral Small 24B nem gpt-oss 20B, que pesam 14 GB. Seu limite teórico atinge cerca de 127 tokens/s em um modelo de 5,3 GB, e 12 GB continuam sendo o limite a ter em mente antes da compra.
A RTX 5070 é a placa de 12 GB mais rápida da geração Blackwell, com uma largura de banda de 672 GB/s. Seu desafio não é a velocidade, mas a capacidade: 12 GB são suficientes para modelos de 4B a 12B, mas não para modelos maiores. Este guia apresenta em números o que cabe na memória, o que excede essa capacidade, como configurar o Ollama para o contexto e em que momento a 5070 Ti de 16 GB se torna a compra certa.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Para este setup: RTX 5070 12 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 5070 para um LLM local: o que 12 GB de GDDR7 permitem
Uma RTX 5070 carrega sem problemas modelos de 4B a 12B em Q4. Qwen 3.5 9B pesa 6,6 GB e Gemma 4 12B 7,7 a 8 GB de acordo com a biblioteca Ollama: ambos cabem dentro dos 12 GB com uma margem de 4 a 5 GB para o contexto, o que permite 16.000 tokens ou mais com o cache K/V quantizado. A placa, no entanto, não carrega nenhum modelo de 14 GB: Mistral Small 24B e gpt-oss 20B ultrapassam os 12 GB. Sua velocidade é excelente para uso interativo: 672 GB/s em um barramento de 192 bits. A 5070, portanto, é adequada para uso comum e encontra um limite claro quando se busca modelos de qualidade superior.
- Arquitetura
- Blackwell, 6 144 núcleos CUDA e Tensor Cores da 5ª geração de acordo com NVIDIA.
- Memória
- 12 GB de GDDR7 em um barramento de 192 bits, 672 GB/s de largura de banda de acordo com a Wikipédia.
- Potência
- 250 W de potência gráfica total; NVIDIA indica 650 W de alimentação mínima para o computador inteiro.
- Preço de lançamento
- 549 dólares, lançamento em 5 de março de 2025 de acordo com a Wikipedia.
#Quais modelos cabem em 12 GB?
| Modelo | Tamanho | Margem disponível em 12 GB | Veredito |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 6,7 GB | Muito amplo, contexto longo |
| Qwen 3.5 9B | 6,6 GB | 5,4 GB | Confortável |
| Gemma 4 12B | 7,7 a 8,0 GB | 4 a 4,3 GB | Confortável, contexto de 16.000 tokens possível |
| Mistral Small 24B | 14 GB | Negativo | Não cabe na VRAM |
| Qwen 3.5 27B | 17 GB | Negativo | Não cabe na VRAM |
O ponto de referência do site é de cerca de 0,6 GB por bilhão de parâmetros em Q4, considerando apenas os pesos. Com 12 GB, isso coloca o limite prático em torno de 14 a 16 bilhões de parâmetros se o contexto permanecer curto, e de 12 bilhões se você quiser trabalhar com documentos longos. Para um modelo de 8B a 9B, a margem é muito superior ao necessário para um contexto comum.
#Instalar Ollama e verificar a placa
- 01Driver NVIDIAOllama exige um driver NVIDIA 550 ou mais recente. Para uma RTX 50, instale o driver mais recente oferecido por NVIDIA e verifique com nvidia-smi.
- 02Instalar OllamaBaixe o instalador para o seu sistema: CUDA está embutido.
- 03Executar um modeloTente ollama run gemma4:12b para testar o limite da placa, ou ollama run qwen3.5:9b para um modelo mais leve.
- 04VerificarExecute o ollama ps: a coluna PROCESSOR deve mostrar 100 % GPU.
#Que velocidade esperar: um limite superior, não uma medição
Nenhuma taxa de geração é apresentada aqui como uma medição própria. O teto de geração é a largura de banda dividida pelo tamanho dos pesos. Uma medição pública de terceiros (LLaMA 3 8B em Q4_K_M com llama.cpp, maio de 2024) registra 106 tokens/s em uma RTX 4080 cujo teto é de 156 tokens/s, ou seja, aproximadamente 68%. Adotando 70% como ordem de grandeza, obtêm-se as seguintes estimativas para um contexto curto.
| Modelo (Q4) | Tamanho do modelo | Teto | Estimativa em 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 127 tokens/s | cerca de 89 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 102 tokens/s | aproximadamente 71 tokens/s |
| Gemma 4 12B | 7,7 GB | 87 tokens/s | aproximadamente 61 tokens/s |
Esses limites são bem superiores à velocidade de leitura humana: a 5070 nunca será lenta nesses modelos. Ela é limitada pela capacidade, não pela velocidade. As estimativas diminuem com o contexto, e a leitura do prompt pesa mais no cálculo do que na memória.
#Gerenciar o contexto em 12 GB
A margem de 4 GB do Gemma 4 12B desaparece rápido com um contexto longo. O Ollama quantiza o cache K/V em q8_0 para usar aproximadamente metade da memória usada pelo f16, o formato padrão, com uma perda de precisão muito baixa segundo sua documentação; isso exige Flash Attention. É essa configuração que torna um modelo de 12B utilizável com documentos longos.
Uma armadilha se você atender várias pessoas: várias requisições em paralelo aumentam proporcionalmente o contexto reservado, de acordo com a FAQ do Ollama. Um modelo que cabe na memória para um usuário pode ultrapassar esse limite para três.
#O que se faz concretamente com 12 GB
Doze gigabytes mudam a natureza dos usos em relação a 8 GB. Um modelo de 9B deixa espaço suficiente para um contexto de 16.000 tokens e um pequeno modelo de embeddings: é a configuração de um RAG pessoal confortável. Um modelo de 12B oferece respostas de melhor qualidade em redação e síntese, ao custo de um contexto mais limitado. Para um assistente de código, bastam um modelo de 8B a 12B e trechos específicos, mas não um repositório inteiro carregado de uma só vez.
| Uso | Realista? | Configuração recomendada |
|---|---|---|
| Chat diário | Sim, muito confortável | Qwen 3.5 9B ou Gemma 4 12B |
| Resumo de documentos longos | Sim, com um contexto de 16.000 tokens | Gemma 4 12B, cache K/V em q8_0 |
| RAG em seus arquivos | Sim | Qwen 3.5 9B e embeddings leves |
| Assistente de código | Sim, com um modelo de 8B a 12B | Trechos selecionados, contexto de 8 192 tokens |
| Modelos de 14 GB ou mais | Não | Prever 16 GB de VRAM |
A escolha entre 9B e 12B depende da tarefa. O 9B deixa mais margem e se adapta a contextos longos; o 12B é mais capaz, mas cada gigabyte de contexto conta. Comece pelo menor que atende à sua necessidade e vá para o 12B apenas se a qualidade o exigir.
#Quando a 5070 já não é suficiente
Três sinais indicam que é necessária mais memória. Você quer um modelo de 14 a 24B, como Mistral Small 24B ou gpt-oss 20B. Você precisa de um contexto acima de 16.000 tokens em um modelo de 12B. Você carrega vários modelos ao mesmo tempo: geração, embeddings, reranker. Nesses casos, a velocidade da 5070 não é o problema, e as próximas opções são a 5070 Ti, a 5080 ou uma placa de 24 GB.
#O que não é possível carregar com 12 GB
| Modelo | Tamanho | Consequência |
|---|---|---|
| Mistral Small 24B | 14 GB | Transfere 2 GB para a RAM |
| Qwen 3.5 27B | 17 GB | Excede bastante a capacidade |
| Qwen 3.5 35B | 24 GB | Fora do alcance: no mínimo 24 GB de VRAM |
| Modelos de 70B em Q4 | cerca de 40 GB | Fora do alcance de uma GPU de 12 GB voltada ao consumidor |
Um modelo que excede a capacidade da VRAM não trava: parte dos pesos é lida da RAM do sistema, e a velocidade cai bastante, já que a conexão PCIe é muito mais lenta que a GDDR7. Um modelo de 14 GB em uma placa com 12 GB é, portanto, utilizável para um teste, mas não para uso diário. Para esses modelos, busque 16 GB ou mais.
#Jogar e executar um LLM na mesma placa
A RTX 5070 costuma servir aos dois usos. O modelo carregado ocupa a VRAM enquanto permanece na memória, e um jogo recente também exige vários gigabytes: com 12 GB, os dois juntos rapidamente excedem a capacidade disponível. A regra é simples: remova o modelo da memória antes de iniciar um jogo e carregue-o novamente depois. O Ollama libera a memória após um período de inatividade, e ollama ps indica o que ainda está carregado. Se você quer um assistente disponível durante suas partidas, prefira um modelo pequeno de 4B.
#Uma 4070 Ti Super usada em vez disso?
A pergunta surge com frequência: uma RTX 4070 Ti Super de segunda mão, com 16 GB, contra uma RTX 5070 nova, com 12 GB. Para o LLM, a capacidade é decisiva: 16 GB carregam modelos de 14 GB que a 5070 não consegue alocar. A 5070 mantém a vantagem da garantia, de consumo mais baixo (250 W) e da memória GDDR7. Se seus modelos cabem em 12 GB, a 5070 nova é uma escolha razoável; caso contrário, a capacidade é prioridade. O guia dedicado detalha a 4070 Ti Super.
#5070 ou 5070 Ti: 12 GB ou 16 GB
| Critério | RTX 5070 | RTX 5070 Ti |
|---|---|---|
| Memória | 12 GB GDDR7, 192 bits | 16 GB GDDR7, 256 bits |
| Largura de banda | 672 GB/s | 896 GB/s |
| Núcleos CUDA | 6 144 | 8 960 |
| Potência gráfica | 250 W | 300 W |
| Fonte de alimentação mínima | 650 W | 750 W |
| Modelos de 14 GB | Não | Sim, com 2 GB de margem |
A 5070 Ti traz duas coisas: 4 GB a mais de memória, o que permite Mistral Small 24B e gpt-oss 20B, e 33 % a mais de banda passante. Os preços recomendados no lançamento eram de 549 dólares para a 5070 e de 749 dólares para a 5070 Ti, ou seja, uma diferença de 200 dólares. Se seus modelos cabem em 12 GB, a 5070 é suficiente; se você busca modelos de 14 GB, essa diferença é um bom investimento. Consulte o rastreamento de preços para comparar no momento da compra.
#Veredito 2026
- Compre uma 5070 se
- Seus modelos têm de 4B a 12B e você quer a velocidade da geração Blackwell. Ela é muito capaz para esse uso.
- Prefira a 5070 Ti se
- Você quer explorar modelos de 14 a 24B: os 16 GB fazem a diferença.
- Cuidado com o jogo e o LLM juntos
- Um jogo recente e um modelo carregado compartilham os 12 GB: feche um antes de iniciar o outro.
Resumindo, a 5070 é uma placa rápida cujo único defeito é estar limitada a 12 GB. Se esse limite não atrapalha você hoje, também não atrapalhará nos próximos meses, desde que você continue usando modelos de 4B a 12B; se atrapalha, é melhor pagar por mais capacidade desde já.
- Fonte: características oficiais NVIDIA (RTX 5070 e 5070 Ti)
- Fonte: FAQ oficial do Ollama (Flash Attention, cache K/V, paralelismo)
- Fonte: tamanhos de Gemma 4 na biblioteca Ollama
#Perguntas frequentes
A RTX 5070 de 12 GB consegue rodar um modelo de 70B?+
Quantos tokens por segundo em uma RTX 5070?+
12 GB são suficientes para uso profissional em 2026?+
A RTX 5070 suporta DLSS 4 e o LLM ao mesmo tempo?+
Qual fonte de alimentação para uma RTX 5070?+
Como verificar se o modelo cabe na VRAM?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.