Iniciante 11 minRTX 30

Qual LLM na RTX 3070 / 3070 Ti (8 GB) ?

Resposta direta

Uma RTX 3070 ou 3070 Ti oferece 8 GB de VRAM: ela mantém na VRAM modelos com até 8 a 9 bilhões de parâmetros em Q4 (Granite 4.2 8B com 5,3 GB, Qwen 3.5 9B com 6,6 GB), mas não os de 12 bilhões ou mais. A 3070 Ti, com 608 GB/s contra 448, gera mais rápido com a mesma capacidade. Não há medições publicadas: as taxas de geração são estimativas.

Com 8 GB, a RTX 3070 e a 3070 Ti continuam sendo placas adequadas para um modelo de 8 bilhões de parâmetros, mas a capacidade é sua limitação. Este guia apresenta os modelos que realmente cabem, com seu tamanho exato, taxas de geração estimadas a partir da largura de banda, limites de contexto e diferenças em relação às placas de especificações próximas. Você também saberá quando passar para 12 ou 16 GB.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-29·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5060 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 3070 e 3070 Ti para um LLM local: o que 8 GB permitem

Para um LLM local, o valor de uma RTX 3070 ou de uma 3070 Ti está nos seus 8 GB de VRAM, e essa capacidade determina tudo: modelos de até 8 a 9 bilhões de parâmetros em Q4 cabem; os de 12 bilhões ou mais, não. Segundo a biblioteca Ollama, Granite 4.2 8B pesa 5,3 GB, Qwen3 8B, 5,2 GB, e Qwen 3.5 9B, 6,6 GB; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) excedem a capacidade da placa. A 3070 Ti, com 608 GB/s contra 448 GB/s da 3070, gera mais rápido, mas tem a mesma capacidade.

Memória
8 GB em um barramento de 256 bits: GDDR6 a 448 GB/s para a 3070, GDDR6X a 608 GB/s para a 3070 Ti, de acordo com a tabela da Wikipedia e a NVIDIA.
Cálculo
5.888 núcleos CUDA para a 3070 e 6.144 para a 3070 Ti, de acordo com a Wikipedia.
Consumo
220 W de potência gráfica e uma fonte de alimentação de 650 W necessária para a 3070; 290 W e 750 W para a 3070 Ti, segundo a NVIDIA. Isso é mais do que os 550 W que às vezes são citados.

#Modelos que cabem em 8 GB

Os pesos são dos arquivos da biblioteca Ollama, consultados em 29 de setembro de 2026. A margem é o que resta em 8 GB antes do contexto, do cache e dos buffers do motor; ela também deve cobrir a exibição, se a placa for responsável pela tela.

Modelos para RTX 3070 / 3070 Ti (arquivos Ollama, Q4 salvo indicação em contrário)
ModeloArquivo OllamaMargem brutaVeredito
Qwen 3.5 4B3,4 GB4,6 GBMuito confortável, contexto longo possível
Qwen3 8B5,2 GB2,8 GBConfortável
Granite 4.2 8B5,3 GB2,7 GBConfortável
Qwen 3.5 9B6,6 GB1,4 GBCabe; é preciso limitar o contexto
Gemma 4 12B7,6 GB0,4 GBSem margem: nenhum contexto útil
Qwen3 14B9,3 GBFaltam 1,3 GBNão cabe
gpt-oss 20B14 GBFaltam 6 GBNão cabe

O ponto de partida mais seguro é um modelo de 8 bilhões: Granite 4.2 8B ou Qwen3 8B deixam cerca de 3 GB para o contexto. Qwen 3.5 9B é o limite superior na prática: 1,4 GB de margem são suficientes para uma conversa curta, não para um documento longo. Um RAG local adiciona um modelo de embeddings: bge-m3 pesa 1,2 GB no Ollama, totalizando 6,5 GB com Granite 4.2 8B, e restam 1,5 GB para o restante.

#Instalar Ollama em uma RTX 3070

  1. 01
    Verificar o driver
    Execute nvidia-smi no terminal: o driver deve estar na versão 550 ou superior (551.61 no Windows) e a memória total deve mostrar cerca de 8 GB.
  2. 02
    Instalar Ollama
    Instale o Ollama pelo site oficial. A API local fica disponível em http://localhost:11434.
  3. 03
    Executar um modelo
    Execute ollama run granite4.2:8b: o download de 5,3 GB é feito apenas uma vez.
  4. 04
    Verificar a distribuição
    Em um segundo terminal, execute ollama ps: a coluna Processador deve mostrar 100% GPU. Uma divisão entre CPU/GPU significa que parte do modelo ou do contexto está sendo carregada na memória RAM.
  5. 05
    Ajustar o contexto
    Defina o contexto com OLLAMA_CONTEXT_LENGTH, depois execute ollama ps novamente. Defina OLLAMA_FLASH_ATTENTION como 1 e OLLAMA_KV_CACHE_TYPE como q8_0 ao iniciar o servidor para economizar VRAM.
Comandos básicos
ollama run granite4.2:8b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Taxas de geração: o que se pode esperar da largura de banda

Nenhum site de benchmark de referência publica medição para a RTX 3070: os valores abaixo são portanto estimativas, não medições. O método se baseia no fato de que a geração é limitada pela largura de banda: o limite teórico equivale aproximadamente à largura de banda dividida pelo peso do modelo. Para Granite 4.2 8B (5,3 GB), 448 ÷ 5,3 dá 85 tokens por segundo na 3070 e 608 ÷ 5,3 dá 115 na 3070 Ti. Para Qwen 3.5 9B (6,6 GB), os limites são 68 e 92.

O ranking comunitário do llama.cpp permite converter esses limites em ordens de grandeza. Com Llama 2 7B Q4_0, uma RTX 3060 Ti de 8 GB, placa com barramento de 256 bits semelhante à 3070, gera 92,23 tokens por segundo sem Flash Attention e 96,50 com. Uma RTX 3060 de 12 GB, com largura de banda de 360 GB/s, gera 75,57 e 76,92: a razão (1,22) acompanha a das larguras de banda (448 ÷ 360 = 1,24). Uma 3070 deve, portanto, apresentar taxas próximas às da 3060 Ti, em torno de 90 a 95 tokens por segundo com um modelo de 7B, e uma 3070 Ti cerca de 35% a mais, ou seja, 120 a 130. São estimativas.

Estimativa de geração, em tokens por segundo (limite máximo teórico, RTX 3070 / 3070 Ti)
ModeloArquivo OllamaLimite 3070 (448 GB/s)Limite 3070 Ti (608 GB/s)
Qwen 3.5 4B3,4 GB132179
Granite 4.2 8B5,3 GB85115
Qwen 3.5 9B6,6 GB6892
Gemma 4 12B7,6 GB5980

As taxas reais ficam em torno de 70 a 80% desses limites nas placas medidas em outras fontes: conte, portanto, com 55 a 65 tokens por segundo para Granite 4.2 8B em uma 3070. Seja qual for o valor exato, essas velocidades superam a velocidade de leitura humana: o limite da 3070 é a capacidade, não a velocidade.

#Limites dos 8 GB: contexto, RAG e grandes modelos

Ollama ajusta o contexto padrão conforme a memória de vídeo: sua documentação indica 4k tokens para menos de 24 GiB de VRAM e recomenda pelo menos 64.000 tokens para agentes, pesquisa na web e ferramentas de código. Com 8 GB, buscar 64.000 tokens com um modelo de 8 bilhões não é realista: o cache KV, que armazena as chaves e os valores de atenção de cada token, consome a margem. De acordo com a FAQ do Ollama, a quantização q8_0 do cache reduz seu consumo de memória para cerca da metade do consumo em f16, com uma perda de precisão muito pequena: é o primeiro ajuste a ativar.

Modelos de 12 a 24 bilhões
Gemma 4 12B (7,6 GB) não deixa espaço para o contexto; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) não cabem. Parte desses modelos passa para a memória RAM, e a velocidade cai.
Contexto longo
Com Qwen 3.5 9B, 1,4 GB de margem se esgotam rapidamente: mantenha um contexto de alguns milhares de tokens e monitore o ollama ps.
RAG em múltiplas etapas
Granite 4.2 8B e bge-m3 ocupam 6,5 GB: adicionar um reranker ou um segundo modelo ultrapassa o limite.
Fine-tuning
De acordo com o Unsloth, o mínimo absoluto em QLoRA de 4 bits é de 3,5 GB para 3 bilhões e de 6 GB para 8 bilhões: um modelo de 8B mal cabe, com um lote de 1 e um contexto curto.

Um método simples para permanecer abaixo de 8 GB envolve três ajustes. Primeiro, escolha um modelo cujo arquivo deixe pelo menos 2 GB de margem: Granite 4.2 8B ou Qwen3 8B. Em seguida, ative o cache quantizado em q8_0 e o Flash Attention, que o repositório oficial do Flash Attention indica ser compatível com GPUs Ampere como a 3070. Por fim, aumente o contexto em etapas, de 4.000 para 8.000 e depois para 16.000 tokens, executando novamente ollama ps a cada etapa: assim que aparecer uma parcela de processamento na CPU, volte para a etapa anterior. Essa progressão evita que você descubra o limite no meio da conversa.

#3070 em comparação com as outras placas de 8 a 16 GB

Placas de categorias próximas para um LLM local (NVIDIA, Hardware Corner)
PlacaMemóriaLargura de bandaO que muda
RTX 30708 GB GDDR6448 GB/sModelos de 8 a 9 bilhões
RTX 3070 Ti8 GB GDDR6X608 GB/sMesma capacidade, geração mais rápida
RTX 3060 12 GB12 GB GDDR6360 GB/sAcrescenta os modelos de 12 a 14 bilhões
RTX 4060 Ti 16 GB16 GB288 GB/sPermite também executar gpt-oss 20B, mas é mais lenta

Essa tabela evidencia a escolha entre capacidade e velocidade. A 3060 12 GB tem uma largura de banda 20% menor que a 3070, mas 4 GB a mais: ela comporta Qwen3 14B (9,3 GB), que não cabe na 3070. A 4060 Ti 16 GB permite usar também modelos da classe dos 20 bilhões de parâmetros, com uma largura de banda de 288 GB/s que a torna mais lenta em modelos pequenos. Para um LLM, a capacidade prevalece sobre a velocidade assim que o modelo desejado ultrapassa 7,5 GB.

#Veredito: manter, substituir ou não comprar

Qual decisão tomar de acordo com sua situação
SituaçãoDecisãoJustificativa em números
Você já tem uma 3070 e quer um 8BManterGranite 4.2 8B : 5,3 GB, aproximadamente 60 t/s estimados
Você quer um modelo de 12B a 14BPassar para 12 ou 16 GBQwen3 14B pesa 9,3 GB, a 3070 tem 8 GB
Você quer um 20B ou um contexto longoPlaca de 16 GB ou maisgpt-oss 20B pesa 14 GB
Você está hesitando entre 3070 e 3070 TiEscolha a mais barataMesma capacidade, 608 contra 448 GB/s
Você procura uma placa para começarComparar com uma 3060 de 12 GBMais memória para uma largura de banda semelhante

A 3070 é uma placa razoável para um modelo de 8 bilhões, nada além disso. Ela continua útil como placa para começar: o Ollama oferece suporte a ela, e um modelo de 8 bilhões responde nela mais rápido do que você consegue ler. Ela não é adequada se você pretende usar agentes de código ou documentos longos, que exigem um contexto que os 8 GB não comportam. Se você já tem essa placa, ela é suficiente para conhecer os LLMs locais. Se estiver escolhendo uma placa apenas para esse uso, comece pela capacidade: um modelo maior que cabe vale mais do que um modelo pequeno e mais rápido. Para os preços do dia, consulte nosso acompanhamento, que registra o menor preço de cada placa duas vezes por semana.

#Perguntas frequentes

FAQ
Qual LLM rodar em uma RTX 3070?+
Comece com Granite 4.2 8B (5,3 GB) ou Qwen3 8B (5,2 GB): eles deixam cerca de 3 GB para o contexto. Qwen 3.5 9B (6,6 GB) é o limite superior, com 1,4 GB de margem. Acima de 9 bilhões de parâmetros em Q4, parte do modelo passa a ocupar a RAM do sistema.
A RTX 3070 consegue rodar um modelo de 14 ou 24 bilhões?+
Não. O Qwen3 14B pesa 9,3 GB no Ollama, ou seja, 1,3 GB a mais que a capacidade da placa, e os modelos de 24 bilhões (15 GB) ou gpt-oss 20B (14 GB) exigem quase o dobro. Parte desses modelos acaba sendo carregada na memória RAM, e a velocidade cai. São necessários pelo menos 12 GB para um modelo de 14B.
RTX 3070 ou RTX 3060 12 GB para um LLM?+
Para um LLM, a 3060 12 GB é geralmente a melhor escolha: 4 GB a mais permitem rodar o Qwen3 14B (9,3 GB). A 3070 tem 448 GB/s de largura de banda contra 360: teoricamente gera cerca de um quarto mais rápido, mas com 8 GB ela se limita a modelos de 8 a 9 bilhões.
Qual a diferença entre 3070 e 3070 Ti para um LLM?+
Mesma capacidade de 8 GB, mas a 3070 Ti tem memória GDDR6X a 608 GB/s contra 448 GB/s em GDDR6, ou seja, 36% de largura de banda a mais. A geração, limitada pela largura de banda, melhora na mesma proporção, em teoria. A Ti consome 290 W contra 220 W de acordo com a NVIDIA.
Qual fonte de alimentação usar para uma RTX 3070 Ti?+
A NVIDIA indica uma fonte de alimentação de 750 W como requisito para o sistema com a 3070 Ti (290 W de potência gráfica) e de 650 W para a 3070 (220 W). São os valores do fabricante para um PC completo: uma fonte de alimentação de 550 W está abaixo dessa recomendação, mesmo que possa ser suficiente em um PC de baixo consumo.
É possível fazer fine-tuning de um modelo em uma RTX 3070?+
Sim, com QLoRA em modelos pequenos. De acordo com o Unsloth, o mínimo absoluto é de 3,5 GB para um modelo de 3B e de 6 GB para um de 8B: com 8 GB, um modelo de 8B mal cabe, com um lote de 1 e contexto curto. Um modelo de 14B exige 8,5 GB e não cabe.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.