Intermediário 11 minRTX 50

Qual LLM na RTX 5070 (12 GB) ?

Resposta direta

A RTX 5070 possui 12 GB de GDDR7 a 672 GB/s: ela carrega na VRAM todos os modelos de até cerca de 10 GB, incluindo Qwen 3.5 9B (6,6 GB) e Gemma 4 12B (7,7 a 8 GB), com uma margem efetiva para o contexto. Ela não carrega Mistral Small 24B nem gpt-oss 20B, que pesam 14 GB. Seu limite teórico atinge cerca de 127 tokens/s em um modelo de 5,3 GB, e 12 GB continuam sendo o limite a ter em mente antes da compra.

A RTX 5070 é a placa de 12 GB mais rápida da geração Blackwell, com uma largura de banda de 672 GB/s. Seu desafio não é a velocidade, mas a capacidade: 12 GB são suficientes para modelos de 4B a 12B, mas não para modelos maiores. Este guia apresenta em números o que cabe na memória, o que excede essa capacidade, como configurar o Ollama para o contexto e em que momento a 5070 Ti de 16 GB se torna a compra certa.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Para este setup: RTX 5070 12 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 5070 para um LLM local: o que 12 GB de GDDR7 permitem

Uma RTX 5070 carrega sem problemas modelos de 4B a 12B em Q4. Qwen 3.5 9B pesa 6,6 GB e Gemma 4 12B 7,7 a 8 GB de acordo com a biblioteca Ollama: ambos cabem dentro dos 12 GB com uma margem de 4 a 5 GB para o contexto, o que permite 16.000 tokens ou mais com o cache K/V quantizado. A placa, no entanto, não carrega nenhum modelo de 14 GB: Mistral Small 24B e gpt-oss 20B ultrapassam os 12 GB. Sua velocidade é excelente para uso interativo: 672 GB/s em um barramento de 192 bits. A 5070, portanto, é adequada para uso comum e encontra um limite claro quando se busca modelos de qualidade superior.

Arquitetura
Blackwell, 6 144 núcleos CUDA e Tensor Cores da 5ª geração de acordo com NVIDIA.
Memória
12 GB de GDDR7 em um barramento de 192 bits, 672 GB/s de largura de banda de acordo com a Wikipédia.
Potência
250 W de potência gráfica total; NVIDIA indica 650 W de alimentação mínima para o computador inteiro.
Preço de lançamento
549 dólares, lançamento em 5 de março de 2025 de acordo com a Wikipedia.

#Quais modelos cabem em 12 GB?

Modelos na RTX 5070 (tamanhos no Ollama, apenas os pesos)
ModeloTamanhoMargem disponível em 12 GBVeredito
Granite 4.2 8B5,3 GB6,7 GBMuito amplo, contexto longo
Qwen 3.5 9B6,6 GB5,4 GBConfortável
Gemma 4 12B7,7 a 8,0 GB4 a 4,3 GBConfortável, contexto de 16.000 tokens possível
Mistral Small 24B14 GBNegativoNão cabe na VRAM
Qwen 3.5 27B17 GBNegativoNão cabe na VRAM

O ponto de referência do site é de cerca de 0,6 GB por bilhão de parâmetros em Q4, considerando apenas os pesos. Com 12 GB, isso coloca o limite prático em torno de 14 a 16 bilhões de parâmetros se o contexto permanecer curto, e de 12 bilhões se você quiser trabalhar com documentos longos. Para um modelo de 8B a 9B, a margem é muito superior ao necessário para um contexto comum.

#Instalar Ollama e verificar a placa

  1. 01
    Driver NVIDIA
    Ollama exige um driver NVIDIA 550 ou mais recente. Para uma RTX 50, instale o driver mais recente oferecido por NVIDIA e verifique com nvidia-smi.
  2. 02
    Instalar Ollama
    Baixe o instalador para o seu sistema: CUDA está embutido.
  3. 03
    Executar um modelo
    Tente ollama run gemma4:12b para testar o limite da placa, ou ollama run qwen3.5:9b para um modelo mais leve.
  4. 04
    Verificar
    Execute o ollama ps: a coluna PROCESSOR deve mostrar 100 % GPU.

#Que velocidade esperar: um limite superior, não uma medição

Nenhuma taxa de geração é apresentada aqui como uma medição própria. O teto de geração é a largura de banda dividida pelo tamanho dos pesos. Uma medição pública de terceiros (LLaMA 3 8B em Q4_K_M com llama.cpp, maio de 2024) registra 106 tokens/s em uma RTX 4080 cujo teto é de 156 tokens/s, ou seja, aproximadamente 68%. Adotando 70% como ordem de grandeza, obtêm-se as seguintes estimativas para um contexto curto.

Limite teórico na RTX 5070 (672 GB/s)
Modelo (Q4)Tamanho do modeloTetoEstimativa em 70 %
Granite 4.2 8B5,3 GB127 tokens/scerca de 89 tokens/s
Qwen 3.5 9B6,6 GB102 tokens/saproximadamente 71 tokens/s
Gemma 4 12B7,7 GB87 tokens/saproximadamente 61 tokens/s

Esses limites são bem superiores à velocidade de leitura humana: a 5070 nunca será lenta nesses modelos. Ela é limitada pela capacidade, não pela velocidade. As estimativas diminuem com o contexto, e a leitura do prompt pesa mais no cálculo do que na memória.

#Gerenciar o contexto em 12 GB

A margem de 4 GB do Gemma 4 12B desaparece rápido com um contexto longo. O Ollama quantiza o cache K/V em q8_0 para usar aproximadamente metade da memória usada pelo f16, o formato padrão, com uma perda de precisão muito baixa segundo sua documentação; isso exige Flash Attention. É essa configuração que torna um modelo de 12B utilizável com documentos longos.

Configurações do servidor Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

Uma armadilha se você atender várias pessoas: várias requisições em paralelo aumentam proporcionalmente o contexto reservado, de acordo com a FAQ do Ollama. Um modelo que cabe na memória para um usuário pode ultrapassar esse limite para três.

#O que se faz concretamente com 12 GB

Doze gigabytes mudam a natureza dos usos em relação a 8 GB. Um modelo de 9B deixa espaço suficiente para um contexto de 16.000 tokens e um pequeno modelo de embeddings: é a configuração de um RAG pessoal confortável. Um modelo de 12B oferece respostas de melhor qualidade em redação e síntese, ao custo de um contexto mais limitado. Para um assistente de código, bastam um modelo de 8B a 12B e trechos específicos, mas não um repositório inteiro carregado de uma só vez.

Uso em RTX 5070 (12 GB)
UsoRealista?Configuração recomendada
Chat diárioSim, muito confortávelQwen 3.5 9B ou Gemma 4 12B
Resumo de documentos longosSim, com um contexto de 16.000 tokensGemma 4 12B, cache K/V em q8_0
RAG em seus arquivosSimQwen 3.5 9B e embeddings leves
Assistente de códigoSim, com um modelo de 8B a 12BTrechos selecionados, contexto de 8 192 tokens
Modelos de 14 GB ou maisNãoPrever 16 GB de VRAM

A escolha entre 9B e 12B depende da tarefa. O 9B deixa mais margem e se adapta a contextos longos; o 12B é mais capaz, mas cada gigabyte de contexto conta. Comece pelo menor que atende à sua necessidade e vá para o 12B apenas se a qualidade o exigir.

#Quando a 5070 já não é suficiente

Três sinais indicam que é necessária mais memória. Você quer um modelo de 14 a 24B, como Mistral Small 24B ou gpt-oss 20B. Você precisa de um contexto acima de 16.000 tokens em um modelo de 12B. Você carrega vários modelos ao mesmo tempo: geração, embeddings, reranker. Nesses casos, a velocidade da 5070 não é o problema, e as próximas opções são a 5070 Ti, a 5080 ou uma placa de 24 GB.

#O que não é possível carregar com 12 GB

Modelos acima do limite de 12 GB (tamanhos Ollama)
ModeloTamanhoConsequência
Mistral Small 24B14 GBTransfere 2 GB para a RAM
Qwen 3.5 27B17 GBExcede bastante a capacidade
Qwen 3.5 35B24 GBFora do alcance: no mínimo 24 GB de VRAM
Modelos de 70B em Q4cerca de 40 GBFora do alcance de uma GPU de 12 GB voltada ao consumidor

Um modelo que excede a capacidade da VRAM não trava: parte dos pesos é lida da RAM do sistema, e a velocidade cai bastante, já que a conexão PCIe é muito mais lenta que a GDDR7. Um modelo de 14 GB em uma placa com 12 GB é, portanto, utilizável para um teste, mas não para uso diário. Para esses modelos, busque 16 GB ou mais.

#Jogar e executar um LLM na mesma placa

A RTX 5070 costuma servir aos dois usos. O modelo carregado ocupa a VRAM enquanto permanece na memória, e um jogo recente também exige vários gigabytes: com 12 GB, os dois juntos rapidamente excedem a capacidade disponível. A regra é simples: remova o modelo da memória antes de iniciar um jogo e carregue-o novamente depois. O Ollama libera a memória após um período de inatividade, e ollama ps indica o que ainda está carregado. Se você quer um assistente disponível durante suas partidas, prefira um modelo pequeno de 4B.

#Uma 4070 Ti Super usada em vez disso?

A pergunta surge com frequência: uma RTX 4070 Ti Super de segunda mão, com 16 GB, contra uma RTX 5070 nova, com 12 GB. Para o LLM, a capacidade é decisiva: 16 GB carregam modelos de 14 GB que a 5070 não consegue alocar. A 5070 mantém a vantagem da garantia, de consumo mais baixo (250 W) e da memória GDDR7. Se seus modelos cabem em 12 GB, a 5070 nova é uma escolha razoável; caso contrário, a capacidade é prioridade. O guia dedicado detalha a 4070 Ti Super.

#5070 ou 5070 Ti: 12 GB ou 16 GB

RTX 5070 e RTX 5070 Ti: o que muda para o LLM
CritérioRTX 5070RTX 5070 Ti
Memória12 GB GDDR7, 192 bits16 GB GDDR7, 256 bits
Largura de banda672 GB/s896 GB/s
Núcleos CUDA6 1448 960
Potência gráfica250 W300 W
Fonte de alimentação mínima650 W750 W
Modelos de 14 GBNãoSim, com 2 GB de margem

A 5070 Ti traz duas coisas: 4 GB a mais de memória, o que permite Mistral Small 24B e gpt-oss 20B, e 33 % a mais de banda passante. Os preços recomendados no lançamento eram de 549 dólares para a 5070 e de 749 dólares para a 5070 Ti, ou seja, uma diferença de 200 dólares. Se seus modelos cabem em 12 GB, a 5070 é suficiente; se você busca modelos de 14 GB, essa diferença é um bom investimento. Consulte o rastreamento de preços para comparar no momento da compra.

#Veredito 2026

Compre uma 5070 se
Seus modelos têm de 4B a 12B e você quer a velocidade da geração Blackwell. Ela é muito capaz para esse uso.
Prefira a 5070 Ti se
Você quer explorar modelos de 14 a 24B: os 16 GB fazem a diferença.
Cuidado com o jogo e o LLM juntos
Um jogo recente e um modelo carregado compartilham os 12 GB: feche um antes de iniciar o outro.

Resumindo, a 5070 é uma placa rápida cujo único defeito é estar limitada a 12 GB. Se esse limite não atrapalha você hoje, também não atrapalhará nos próximos meses, desde que você continue usando modelos de 4B a 12B; se atrapalha, é melhor pagar por mais capacidade desde já.

#Perguntas frequentes

FAQ
A RTX 5070 de 12 GB consegue rodar um modelo de 70B?+
Não. Um 70B em Q4 ocupa aproximadamente 40 GB só com os pesos, o que é mais de três vezes os 12 GB da placa. Mesmo transferindo parte do modelo para a RAM do sistema, a geração seria extremamente lenta. Com 12 GB, fique com modelos de 4B a 12B; para um 70B, reserve pelo menos 48 GB de memória.
Quantos tokens por segundo em uma RTX 5070?+
Nenhuma medida confiável é publicada aqui. O limite teórico, banda passante de 672 GB/s dividida pelo tamanho do modelo, é de cerca de 127 tokens/s para o Granite 4.2 8B (5,3 GB), ou cerca de 89 tokens/s a 70% desse limite. Trata-se de uma estimativa que diminui quando o contexto se alonga.
12 GB são suficientes para uso profissional em 2026?+
Para chat, resumo, RAG ou extração com um modelo de 4B a 12B, sim. Para redação de alta qualidade ou um assistente de código em um repositório grande, os modelos de 14 a 24B que ocupam 14 GB ou mais excedem a capacidade da placa: planeje usar 16 GB.
A RTX 5070 suporta DLSS 4 e o LLM ao mesmo tempo?+
Os dois funcionam na placa, mas compartilham os 12 GB de VRAM. Um jogo recente ocupa uma parte significativa da memória: carregue o modelo antes de jogar ou feche-o enquanto você joga. O LLM e o jogo não devem rodar juntos nos 12 GB.
Qual fonte de alimentação para uma RTX 5070?+
A NVIDIA indica 250 W de potência gráfica total e 650 W de alimentação mínima para o PC inteiro. Uma fonte de qualidade de 650 W é suficiente; 550 W está abaixo da recomendação. Verifique também os conectores do modelo da placa.
Como verificar se o modelo cabe na VRAM?+
Após o carregamento, execute ollama ps: a coluna PROCESSOR deve indicar 100% GPU. Uma divisão entre CPU e GPU significa que parte do modelo está na RAM do sistema, o que torna a geração consideravelmente mais lenta. Reduza então o contexto, ative o cache K/V em q8_0 ou escolha um modelo menor.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.