Qual LLM para RTX 4070 Ti Super (16 GB) ?
A RTX 4070 Ti Super é uma placa com 16 GB de GDDR6X a 672 GB/s: ela carrega na VRAM Gemma 4 12B (7,7 a 8 GB), gpt-oss 20B, Mistral Small 24B (14 GB cada) e todos os modelos até cerca de 14 GB. É a única placa da família 4070 a ultrapassar 12 GB, e sua largura de banda é mais de duas vezes a de uma RTX 4060 Ti 16 GB. Seu limite teórico atinge cerca de 127 tokens/s em um modelo de 5,3 GB.
Quando procuramos um LLM local para rodar em uma RTX 4070, encontramos quatro placas semelhantes: 4070, 4070 Super, 4070 Ti e 4070 Ti Super. Apenas uma oferece 16 GB. Este guia explica o que essa capacidade e esse barramento de 256 bits permitem, o que permanece fora do alcance e como a placa se compara a uma RTX 4080 Super ou uma RTX 5070 Ti.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5070 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 4070 Ti Super para um LLM local: o que 16 GB permitem
Uma RTX 4070 Ti Super roda com facilidade modelos de 4B a 24B em Q4. Ela possui 16 GB de GDDR6X em um barramento de 256 bits, o que equivale a 672 GB/s, e 8.448 núcleos CUDA de acordo com a NVIDIA. Essa combinação a coloca acima de todas as placas de 8 e 12 GB: Gemma 4 12B cabe com uma ampla margem para o contexto, gpt-oss 20B e Mistral Small 24B, cada um de 14 GB, entram na VRAM com cerca de 2 GB de margem, e um modelo de 5 a 8 GB roda perto do limite da largura de banda da placa. O que não cabe é o próximo nível: Qwen 3.5 27B pesa 17 GB e excede a capacidade da placa. A 4070 Ti Super, portanto, não é uma placa para modelos de 30B, mas uma das mais equilibradas para tudo o que está abaixo disso.
- Arquitetura
- Ada Lovelace, chip AD103, o mesmo da RTX 4080, mas com menos unidades ativas.
- Memória
- 16 GB de GDDR6X, barramento de 256 bits, largura de banda de 672 GB/s de acordo com a Wikipedia.
- Cálculo
- 8.448 núcleos CUDA de acordo com a página do produto NVIDIA, Tensor Cores da 4ª geração.
- Potência
- 285 W de potência gráfica total; NVIDIA indica 700 W de alimentação mínima para todo o PC.
#4070, 4070 Super, 4070 Ti, 4070 Ti Super: qual escolher para usar um LLM
As quatro placas têm o mesmo nome de linha, mas não são equivalentes para executar LLMs. Três delas estão limitadas a 12 GB de VRAM; apenas a Ti Super chega a 16 GB e conta com um barramento de 256 bits. Para a IA local, essa diferença pesa mais do que a potência de cálculo bruta: ela determina quais modelos a placa consegue executar.
| Placa | Memória | Barramento | Núcleos CUDA | Potência |
|---|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 256 bits | 8 448 | 285 W |
| RTX 4070 Ti | 12 GB GDDR6X | 192 bits | 7 680 | 285 W |
| RTX 4070 Super | 12 GB GDDR6X | 192 bits | 7 168 | 220 W |
| RTX 4070 | 12 GB GDDR6 ou GDDR6X | 192 bits | 5 888 | 200 W |
A RTX 4070 Ti apresenta 504 GB/s de acordo com a Wikipedia, contra 672 GB/s para a Ti Super. Se você estava pesquisando uma RTX 4070 convencional, a página dedicada trata da variante de 12 GB. Um ponto em comum entre todas: os modelos de 12B cabem na memória, enquanto os de 14 GB ou mais exigem 16 GB.
#Quais modelos cabem em 16 GB
| Modelo | Tamanho | Margem em 16 GB | Veredito |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 10,7 GB | Muito amplo: contexto longo |
| Gemma 4 12B | 7,7 a 8,0 GB | 8 GB | Confortável |
| gpt-oss 20B | 14 GB | 2 GB | Cabe, mas é preciso monitorar o contexto |
| Mistral Small 24B | 14 GB | 2 GB | Cabe, mas é preciso monitorar o contexto |
| Devstral Small 2 24B | 15 GB | 1 GB | Cabe por pouco, contexto muito curto |
| Qwen 3.5 27B | 17 GB | Negativo | Não cabe |
Os modelos de 14 e 15 GB deixam pouco espaço para o cache de contexto: Ollama usa 4 096 tokens por padrão, o que funciona, mas 16 000 tokens exigem quantizar o cache K/V. O Devstral Small 2, um modelo de código, está no limite: com 15 GB, sobra quase nada para o contexto. Para código, Mistral Small 24B ou um modelo menor com um contexto mais longo é uma melhor escolha em 16 GB.
#O que fica fora do alcance dos 16 GB
Três famílias de modelos excedem a capacidade da placa. Os de 27B a 35B em Q4: segundo o Ollama, Qwen 3.5 27B pesa 17 GB e Qwen 3.5 35B pesa 24 GB; Gemma 4 26B pesa de 16 a 19 GB. Os de 70B, cujos pesos, por si só, ficam em torno de 40 GB segundo a referência do site. E os modelos de contexto longo usados no limite máximo: um modelo de 8 GB com 256.000 tokens de contexto anunciado nunca caberá com um cache completo. Para esses casos, passe para 24 GB de VRAM, para um Mac com memória unificada ou para uma máquina dedicada: a página dedicada ao hardware compara essas opções.
#Instalar e verificar a alocação na VRAM
- 01DriverOllama exige um driver NVIDIA 550 ou mais recente para as placas GeForce recentes. Verifique a sua versão com nvidia-smi.
- 02InstalaçãoInstale Ollama no seu sistema, sem instalação separada do CUDA.
- 03Primeiro testeInicie ollama run mistral-small para um primeiro modelo que utilize os 16 GB, depois execute ollama ps.
- 04ControleA coluna PROCESSOR deve mostrar 100% GPU; caso contrário, reduza o contexto.
O cache K/V em q8_0 usa aproximadamente metade da memória do f16, padrão, e exige Flash Attention. É essa configuração que permite a um modelo de 14 GB servir um contexto de 16 000 tokens em 16 GB.
#Qual velocidade esperar: limites e medições de terceiros
Nenhuma taxa de geração é apresentada aqui como uma medição própria. O limite máximo de geração é a largura de banda dividida pelo tamanho dos pesos. Uma medição pública de terceiros (LLaMA 3 8B em Q4_K_M com llama.cpp, maio de 2024) registra 106 tokens/s em uma RTX 4080 com largura de banda de 716,8 GB/s, ou seja, cerca de 68% do seu limite máximo, e 75% em uma RTX 4070 Ti. A largura de banda da 4070 Ti Super é próxima à da 4080, portanto, sua ordem de grandeza de geração também é semelhante. A tabela aplica 70% ao limite máximo.
| Modelo | Tamanho do modelo | Teto | Estimativa em 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 127 tokens/s | cerca de 89 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 102 tokens/s | aproximadamente 71 tokens/s |
| Gemma 4 12B | 7,7 GB | 87 tokens/s | aproximadamente 61 tokens/s |
| Mistral Small 24B | 14 GB | 48 tokens/s | aproximadamente 34 tokens/s |
gpt-oss 20B é um modelo de especialistas: ele lê apenas parte de seus pesos por token, portanto sua taxa de geração supera a de um modelo denso de 14 GB. Nenhum valor respaldado por uma fonte é reproduzido aqui. Lembre-se sobretudo de que a placa passa de rápida com um 8B a satisfatória com um 24B.
#4070 Ti Super frente à 4080 Super e à 5070 Ti
| Placa | VRAM | Largura de banda | Observação |
|---|---|---|---|
| RTX 4070 Ti Super | 16 GB GDDR6X | 672 GB/s | Mesmo chip AD103 que a 4080 |
| RTX 4080 Super | 16 GB GDDR6X | 736 GB/s | Aproximadamente 10 % a mais de largura de banda |
| RTX 5070 Ti | 16 GB GDDR7 | 896 GB/s | 33 % a mais de largura de banda |
As três placas oferecem 16 GB: a capacidade é a mesma, portanto a lista de modelos também. Apenas a velocidade de geração muda, proporcionalmente à largura de banda. A 4080 Super ganha cerca de 10%; a 5070 Ti, cerca de um terço. No mercado de usados, a diferença de preço conta mais do que essas diferenças na taxa de geração: consulte o acompanhamento de preços para comparar. Uma 4070 Ti Super usada a um bom preço continua sendo uma excelente escolha; uma 5070 Ti nova se justifica pela garantia e pela velocidade.
#Usos que se beneficiam dos 16 GB
Os 16 GB mudam principalmente o que é possível rodar ao mesmo tempo. Um RAG local combina um modelo de geração, um modelo de embeddings e um contexto bastante longo para conter os trechos encontrados: com Gemma 4 12B (7,7 a 8 GB) e um pequeno modelo de embeddings, o conjunto cabe com vários gigabytes de margem. Um assistente de código precisa apenas de um modelo de 8B a 12B e de um contexto de 16.000 tokens, sem nenhuma restrição. Um modelo de 14 GB como Mistral Small 24B ocupa quase toda a placa: torna-se uma escolha exclusiva, não um modelo entre outros.
| Uso | Configuração | Espaço restante |
|---|---|---|
| RAG pessoal | Gemma 4 12B e modelo de embeddings leve | Aproximadamente 7 GB para o contexto |
| Assistente de código | Modelo de 8B, contexto de 16.000 tokens, cache q8_0 | Aproximadamente 9 GB |
| Chat de qualidade máxima | Apenas Mistral Small 24B | Aproximadamente 2 GB, contexto curto |
Uma armadilha no uso compartilhado: no Ollama, várias requisições em paralelo ao mesmo modelo aumentam proporcionalmente o tamanho do contexto reservado. Atender três colegas com um modelo de 14 GB pode, portanto, exceder a memória da placa, enquanto um único usuário consegue usá-lo sem dificuldade. Com 16 GB, limite o paralelismo ou escolha um modelo mais leve para uso compartilhado.
#Comprar uma 4070 Ti Super de segunda mão: o que deve ser verificado
A placa foi lançada em janeiro de 2024: a maioria das unidades usadas tem menos de três anos, mas não há garantia quanto ao uso anterior delas. Os preços mudam a cada semana: consulte o acompanhamento de preços em vez de um valor fixo neste guia. Antes de comprar, verifique se nvidia-smi realmente mostra 16 GB de memória, execute um modelo de 14 GB, monitore a temperatura durante uma geração longa e ouça as ventoinhas. Peça a nota fiscal e a garantia restante do fabricante: elas costumam ser transferidas junto com a placa.
#Veredito 2026
- Mantenha-a se
- Seus modelos cabem em 16 GB. Nada justifica substituir a placa antes de você precisar de 24 GB.
- Compre-a usada se
- O preço é consideravelmente inferior ao de uma 5070 Ti nova. Verifique a garantia restante, a temperatura e o barulho dos ventiladores.
- Busque 24 GB se
- Você quer Qwen 3.5 27B ou mais: nenhum ajuste fará entrar 17 GB em 16 GB com contexto, e uma placa de 24 GB evita a necessidade de comprar novamente.
- Fonte: características oficiais NVIDIA (família RTX 4070)
- Fonte: FAQ oficial do Ollama (Flash Attention, cache K/V)
- Fonte: tamanho de Mistral Small na biblioteca Ollama
#Perguntas frequentes
A RTX 4070 Ti Super consegue rodar Mistral Small 24B?+
Qual a diferença entre RTX 4070 Ti e 4070 Ti Super para um LLM?+
RTX 4070 Ti Super ou RTX 5070 Ti?+
A RTX 4070 Ti Super ou a 4080 para um LLM?+
Qual fonte de alimentação é necessária para uma RTX 4070 Ti Super?+
É possível rodar o Qwen 3.5 27B em uma RTX 4070 Ti Super?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.