Qual LLM na RTX 3070 / 3070 Ti (8 GB) ?
Uma RTX 3070 ou 3070 Ti oferece 8 GB de VRAM: ela mantém na VRAM modelos com até 8 a 9 bilhões de parâmetros em Q4 (Granite 4.2 8B com 5,3 GB, Qwen 3.5 9B com 6,6 GB), mas não os de 12 bilhões ou mais. A 3070 Ti, com 608 GB/s contra 448, gera mais rápido com a mesma capacidade. Não há medições publicadas: as taxas de geração são estimativas.
Com 8 GB, a RTX 3070 e a 3070 Ti continuam sendo placas adequadas para um modelo de 8 bilhões de parâmetros, mas a capacidade é sua limitação. Este guia apresenta os modelos que realmente cabem, com seu tamanho exato, taxas de geração estimadas a partir da largura de banda, limites de contexto e diferenças em relação às placas de especificações próximas. Você também saberá quando passar para 12 ou 16 GB.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5060 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 3070 e 3070 Ti para um LLM local: o que 8 GB permitem
Para um LLM local, o valor de uma RTX 3070 ou de uma 3070 Ti está nos seus 8 GB de VRAM, e essa capacidade determina tudo: modelos de até 8 a 9 bilhões de parâmetros em Q4 cabem; os de 12 bilhões ou mais, não. Segundo a biblioteca Ollama, Granite 4.2 8B pesa 5,3 GB, Qwen3 8B, 5,2 GB, e Qwen 3.5 9B, 6,6 GB; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) excedem a capacidade da placa. A 3070 Ti, com 608 GB/s contra 448 GB/s da 3070, gera mais rápido, mas tem a mesma capacidade.
- Memória
- 8 GB em um barramento de 256 bits: GDDR6 a 448 GB/s para a 3070, GDDR6X a 608 GB/s para a 3070 Ti, de acordo com a tabela da Wikipedia e a NVIDIA.
- Cálculo
- 5.888 núcleos CUDA para a 3070 e 6.144 para a 3070 Ti, de acordo com a Wikipedia.
- Consumo
- 220 W de potência gráfica e uma fonte de alimentação de 650 W necessária para a 3070; 290 W e 750 W para a 3070 Ti, segundo a NVIDIA. Isso é mais do que os 550 W que às vezes são citados.
#Modelos que cabem em 8 GB
Os pesos são dos arquivos da biblioteca Ollama, consultados em 29 de setembro de 2026. A margem é o que resta em 8 GB antes do contexto, do cache e dos buffers do motor; ela também deve cobrir a exibição, se a placa for responsável pela tela.
| Modelo | Arquivo Ollama | Margem bruta | Veredito |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 4,6 GB | Muito confortável, contexto longo possível |
| Qwen3 8B | 5,2 GB | 2,8 GB | Confortável |
| Granite 4.2 8B | 5,3 GB | 2,7 GB | Confortável |
| Qwen 3.5 9B | 6,6 GB | 1,4 GB | Cabe; é preciso limitar o contexto |
| Gemma 4 12B | 7,6 GB | 0,4 GB | Sem margem: nenhum contexto útil |
| Qwen3 14B | 9,3 GB | Faltam 1,3 GB | Não cabe |
| gpt-oss 20B | 14 GB | Faltam 6 GB | Não cabe |
O ponto de partida mais seguro é um modelo de 8 bilhões: Granite 4.2 8B ou Qwen3 8B deixam cerca de 3 GB para o contexto. Qwen 3.5 9B é o limite superior na prática: 1,4 GB de margem são suficientes para uma conversa curta, não para um documento longo. Um RAG local adiciona um modelo de embeddings: bge-m3 pesa 1,2 GB no Ollama, totalizando 6,5 GB com Granite 4.2 8B, e restam 1,5 GB para o restante.
#Instalar Ollama em uma RTX 3070
- 01Verificar o driverExecute nvidia-smi no terminal: o driver deve estar na versão 550 ou superior (551.61 no Windows) e a memória total deve mostrar cerca de 8 GB.
- 02Instalar OllamaInstale o Ollama pelo site oficial. A API local fica disponível em http://localhost:11434.
- 03Executar um modeloExecute ollama run granite4.2:8b: o download de 5,3 GB é feito apenas uma vez.
- 04Verificar a distribuiçãoEm um segundo terminal, execute ollama ps: a coluna Processador deve mostrar 100% GPU. Uma divisão entre CPU/GPU significa que parte do modelo ou do contexto está sendo carregada na memória RAM.
- 05Ajustar o contextoDefina o contexto com OLLAMA_CONTEXT_LENGTH, depois execute ollama ps novamente. Defina OLLAMA_FLASH_ATTENTION como 1 e OLLAMA_KV_CACHE_TYPE como q8_0 ao iniciar o servidor para economizar VRAM.
#Taxas de geração: o que se pode esperar da largura de banda
Nenhum site de benchmark de referência publica medição para a RTX 3070: os valores abaixo são portanto estimativas, não medições. O método se baseia no fato de que a geração é limitada pela largura de banda: o limite teórico equivale aproximadamente à largura de banda dividida pelo peso do modelo. Para Granite 4.2 8B (5,3 GB), 448 ÷ 5,3 dá 85 tokens por segundo na 3070 e 608 ÷ 5,3 dá 115 na 3070 Ti. Para Qwen 3.5 9B (6,6 GB), os limites são 68 e 92.
O ranking comunitário do llama.cpp permite converter esses limites em ordens de grandeza. Com Llama 2 7B Q4_0, uma RTX 3060 Ti de 8 GB, placa com barramento de 256 bits semelhante à 3070, gera 92,23 tokens por segundo sem Flash Attention e 96,50 com. Uma RTX 3060 de 12 GB, com largura de banda de 360 GB/s, gera 75,57 e 76,92: a razão (1,22) acompanha a das larguras de banda (448 ÷ 360 = 1,24). Uma 3070 deve, portanto, apresentar taxas próximas às da 3060 Ti, em torno de 90 a 95 tokens por segundo com um modelo de 7B, e uma 3070 Ti cerca de 35% a mais, ou seja, 120 a 130. São estimativas.
| Modelo | Arquivo Ollama | Limite 3070 (448 GB/s) | Limite 3070 Ti (608 GB/s) |
|---|---|---|---|
| Qwen 3.5 4B | 3,4 GB | 132 | 179 |
| Granite 4.2 8B | 5,3 GB | 85 | 115 |
| Qwen 3.5 9B | 6,6 GB | 68 | 92 |
| Gemma 4 12B | 7,6 GB | 59 | 80 |
As taxas reais ficam em torno de 70 a 80% desses limites nas placas medidas em outras fontes: conte, portanto, com 55 a 65 tokens por segundo para Granite 4.2 8B em uma 3070. Seja qual for o valor exato, essas velocidades superam a velocidade de leitura humana: o limite da 3070 é a capacidade, não a velocidade.
#Limites dos 8 GB: contexto, RAG e grandes modelos
Ollama ajusta o contexto padrão conforme a memória de vídeo: sua documentação indica 4k tokens para menos de 24 GiB de VRAM e recomenda pelo menos 64.000 tokens para agentes, pesquisa na web e ferramentas de código. Com 8 GB, buscar 64.000 tokens com um modelo de 8 bilhões não é realista: o cache KV, que armazena as chaves e os valores de atenção de cada token, consome a margem. De acordo com a FAQ do Ollama, a quantização q8_0 do cache reduz seu consumo de memória para cerca da metade do consumo em f16, com uma perda de precisão muito pequena: é o primeiro ajuste a ativar.
- Modelos de 12 a 24 bilhões
- Gemma 4 12B (7,6 GB) não deixa espaço para o contexto; Qwen3 14B (9,3 GB) e gpt-oss 20B (14 GB) não cabem. Parte desses modelos passa para a memória RAM, e a velocidade cai.
- Contexto longo
- Com Qwen 3.5 9B, 1,4 GB de margem se esgotam rapidamente: mantenha um contexto de alguns milhares de tokens e monitore o ollama ps.
- RAG em múltiplas etapas
- Granite 4.2 8B e bge-m3 ocupam 6,5 GB: adicionar um reranker ou um segundo modelo ultrapassa o limite.
- Fine-tuning
- De acordo com o Unsloth, o mínimo absoluto em QLoRA de 4 bits é de 3,5 GB para 3 bilhões e de 6 GB para 8 bilhões: um modelo de 8B mal cabe, com um lote de 1 e um contexto curto.
Um método simples para permanecer abaixo de 8 GB envolve três ajustes. Primeiro, escolha um modelo cujo arquivo deixe pelo menos 2 GB de margem: Granite 4.2 8B ou Qwen3 8B. Em seguida, ative o cache quantizado em q8_0 e o Flash Attention, que o repositório oficial do Flash Attention indica ser compatível com GPUs Ampere como a 3070. Por fim, aumente o contexto em etapas, de 4.000 para 8.000 e depois para 16.000 tokens, executando novamente ollama ps a cada etapa: assim que aparecer uma parcela de processamento na CPU, volte para a etapa anterior. Essa progressão evita que você descubra o limite no meio da conversa.
#3070 em comparação com as outras placas de 8 a 16 GB
| Placa | Memória | Largura de banda | O que muda |
|---|---|---|---|
| RTX 3070 | 8 GB GDDR6 | 448 GB/s | Modelos de 8 a 9 bilhões |
| RTX 3070 Ti | 8 GB GDDR6X | 608 GB/s | Mesma capacidade, geração mais rápida |
| RTX 3060 12 GB | 12 GB GDDR6 | 360 GB/s | Acrescenta os modelos de 12 a 14 bilhões |
| RTX 4060 Ti 16 GB | 16 GB | 288 GB/s | Permite também executar gpt-oss 20B, mas é mais lenta |
Essa tabela evidencia a escolha entre capacidade e velocidade. A 3060 12 GB tem uma largura de banda 20% menor que a 3070, mas 4 GB a mais: ela comporta Qwen3 14B (9,3 GB), que não cabe na 3070. A 4060 Ti 16 GB permite usar também modelos da classe dos 20 bilhões de parâmetros, com uma largura de banda de 288 GB/s que a torna mais lenta em modelos pequenos. Para um LLM, a capacidade prevalece sobre a velocidade assim que o modelo desejado ultrapassa 7,5 GB.
#Veredito: manter, substituir ou não comprar
| Situação | Decisão | Justificativa em números |
|---|---|---|
| Você já tem uma 3070 e quer um 8B | Manter | Granite 4.2 8B : 5,3 GB, aproximadamente 60 t/s estimados |
| Você quer um modelo de 12B a 14B | Passar para 12 ou 16 GB | Qwen3 14B pesa 9,3 GB, a 3070 tem 8 GB |
| Você quer um 20B ou um contexto longo | Placa de 16 GB ou mais | gpt-oss 20B pesa 14 GB |
| Você está hesitando entre 3070 e 3070 Ti | Escolha a mais barata | Mesma capacidade, 608 contra 448 GB/s |
| Você procura uma placa para começar | Comparar com uma 3060 de 12 GB | Mais memória para uma largura de banda semelhante |
A 3070 é uma placa razoável para um modelo de 8 bilhões, nada além disso. Ela continua útil como placa para começar: o Ollama oferece suporte a ela, e um modelo de 8 bilhões responde nela mais rápido do que você consegue ler. Ela não é adequada se você pretende usar agentes de código ou documentos longos, que exigem um contexto que os 8 GB não comportam. Se você já tem essa placa, ela é suficiente para conhecer os LLMs locais. Se estiver escolhendo uma placa apenas para esse uso, comece pela capacidade: um modelo maior que cabe vale mais do que um modelo pequeno e mais rápido. Para os preços do dia, consulte nosso acompanhamento, que registra o menor preço de cada placa duas vezes por semana.
- Fonte: NVIDIA, especificações RTX 3070 e 3070 Ti
- Fonte: classificação comunitária do llama.cpp em CUDA
- Fonte: documentação do Ollama, comprimento de contexto
- Fonte: FAQ do Ollama, Flash Attention e cache KV
- Fonte: Unsloth, VRAM necessária para fine-tuning
#Perguntas frequentes
Qual LLM rodar em uma RTX 3070?+
A RTX 3070 consegue rodar um modelo de 14 ou 24 bilhões?+
RTX 3070 ou RTX 3060 12 GB para um LLM?+
Qual a diferença entre 3070 e 3070 Ti para um LLM?+
Qual fonte de alimentação usar para uma RTX 3070 Ti?+
É possível fazer fine-tuning de um modelo em uma RTX 3070?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.