Intermediário 11 minRTX 40

Qual LLM para RTX 4070 Ti Super (16 GB) ?

Resposta direta

A RTX 4070 Ti Super é uma placa com 16 GB de GDDR6X a 672 GB/s: ela carrega na VRAM Gemma 4 12B (7,7 a 8 GB), gpt-oss 20B, Mistral Small 24B (14 GB cada) e todos os modelos até cerca de 14 GB. É a única placa da família 4070 a ultrapassar 12 GB, e sua largura de banda é mais de duas vezes a de uma RTX 4060 Ti 16 GB. Seu limite teórico atinge cerca de 127 tokens/s em um modelo de 5,3 GB.

Quando procuramos um LLM local para rodar em uma RTX 4070, encontramos quatro placas semelhantes: 4070, 4070 Super, 4070 Ti e 4070 Ti Super. Apenas uma oferece 16 GB. Este guia explica o que essa capacidade e esse barramento de 256 bits permitem, o que permanece fora do alcance e como a placa se compara a uma RTX 4080 Super ou uma RTX 5070 Ti.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5070 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 4070 Ti Super para um LLM local: o que 16 GB permitem

Uma RTX 4070 Ti Super roda com facilidade modelos de 4B a 24B em Q4. Ela possui 16 GB de GDDR6X em um barramento de 256 bits, o que equivale a 672 GB/s, e 8.448 núcleos CUDA de acordo com a NVIDIA. Essa combinação a coloca acima de todas as placas de 8 e 12 GB: Gemma 4 12B cabe com uma ampla margem para o contexto, gpt-oss 20B e Mistral Small 24B, cada um de 14 GB, entram na VRAM com cerca de 2 GB de margem, e um modelo de 5 a 8 GB roda perto do limite da largura de banda da placa. O que não cabe é o próximo nível: Qwen 3.5 27B pesa 17 GB e excede a capacidade da placa. A 4070 Ti Super, portanto, não é uma placa para modelos de 30B, mas uma das mais equilibradas para tudo o que está abaixo disso.

Arquitetura
Ada Lovelace, chip AD103, o mesmo da RTX 4080, mas com menos unidades ativas.
Memória
16 GB de GDDR6X, barramento de 256 bits, largura de banda de 672 GB/s de acordo com a Wikipedia.
Cálculo
8.448 núcleos CUDA de acordo com a página do produto NVIDIA, Tensor Cores da 4ª geração.
Potência
285 W de potência gráfica total; NVIDIA indica 700 W de alimentação mínima para todo o PC.

#4070, 4070 Super, 4070 Ti, 4070 Ti Super: qual escolher para usar um LLM

As quatro placas têm o mesmo nome de linha, mas não são equivalentes para executar LLMs. Três delas estão limitadas a 12 GB de VRAM; apenas a Ti Super chega a 16 GB e conta com um barramento de 256 bits. Para a IA local, essa diferença pesa mais do que a potência de cálculo bruta: ela determina quais modelos a placa consegue executar.

Linha RTX 4070: o que importa para o LLM (fonte NVIDIA)
PlacaMemóriaBarramentoNúcleos CUDAPotência
RTX 4070 Ti Super16 GB GDDR6X256 bits8 448285 W
RTX 4070 Ti12 GB GDDR6X192 bits7 680285 W
RTX 4070 Super12 GB GDDR6X192 bits7 168220 W
RTX 407012 GB GDDR6 ou GDDR6X192 bits5 888200 W

A RTX 4070 Ti apresenta 504 GB/s de acordo com a Wikipedia, contra 672 GB/s para a Ti Super. Se você estava pesquisando uma RTX 4070 convencional, a página dedicada trata da variante de 12 GB. Um ponto em comum entre todas: os modelos de 12B cabem na memória, enquanto os de 14 GB ou mais exigem 16 GB.

#Quais modelos cabem em 16 GB

Modelos na RTX 4070 Ti Super (tamanhos no Ollama, apenas os pesos)
ModeloTamanhoMargem em 16 GBVeredito
Granite 4.2 8B5,3 GB10,7 GBMuito amplo: contexto longo
Gemma 4 12B7,7 a 8,0 GB8 GBConfortável
gpt-oss 20B14 GB2 GBCabe, mas é preciso monitorar o contexto
Mistral Small 24B14 GB2 GBCabe, mas é preciso monitorar o contexto
Devstral Small 2 24B15 GB1 GBCabe por pouco, contexto muito curto
Qwen 3.5 27B17 GBNegativoNão cabe

Os modelos de 14 e 15 GB deixam pouco espaço para o cache de contexto: Ollama usa 4 096 tokens por padrão, o que funciona, mas 16 000 tokens exigem quantizar o cache K/V. O Devstral Small 2, um modelo de código, está no limite: com 15 GB, sobra quase nada para o contexto. Para código, Mistral Small 24B ou um modelo menor com um contexto mais longo é uma melhor escolha em 16 GB.

#O que fica fora do alcance dos 16 GB

Três famílias de modelos excedem a capacidade da placa. Os de 27B a 35B em Q4: segundo o Ollama, Qwen 3.5 27B pesa 17 GB e Qwen 3.5 35B pesa 24 GB; Gemma 4 26B pesa de 16 a 19 GB. Os de 70B, cujos pesos, por si só, ficam em torno de 40 GB segundo a referência do site. E os modelos de contexto longo usados no limite máximo: um modelo de 8 GB com 256.000 tokens de contexto anunciado nunca caberá com um cache completo. Para esses casos, passe para 24 GB de VRAM, para um Mac com memória unificada ou para uma máquina dedicada: a página dedicada ao hardware compara essas opções.

#Instalar e verificar a alocação na VRAM

  1. 01
    Driver
    Ollama exige um driver NVIDIA 550 ou mais recente para as placas GeForce recentes. Verifique a sua versão com nvidia-smi.
  2. 02
    Instalação
    Instale Ollama no seu sistema, sem instalação separada do CUDA.
  3. 03
    Primeiro teste
    Inicie ollama run mistral-small para um primeiro modelo que utilize os 16 GB, depois execute ollama ps.
  4. 04
    Controle
    A coluna PROCESSOR deve mostrar 100% GPU; caso contrário, reduza o contexto.
Contexto longo em 16 GB (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

O cache K/V em q8_0 usa aproximadamente metade da memória do f16, padrão, e exige Flash Attention. É essa configuração que permite a um modelo de 14 GB servir um contexto de 16 000 tokens em 16 GB.

#Qual velocidade esperar: limites e medições de terceiros

Nenhuma taxa de geração é apresentada aqui como uma medição própria. O limite máximo de geração é a largura de banda dividida pelo tamanho dos pesos. Uma medição pública de terceiros (LLaMA 3 8B em Q4_K_M com llama.cpp, maio de 2024) registra 106 tokens/s em uma RTX 4080 com largura de banda de 716,8 GB/s, ou seja, cerca de 68% do seu limite máximo, e 75% em uma RTX 4070 Ti. A largura de banda da 4070 Ti Super é próxima à da 4080, portanto, sua ordem de grandeza de geração também é semelhante. A tabela aplica 70% ao limite máximo.

Limite máximo teórico na RTX 4070 Ti Super (672 GB/s)
ModeloTamanho do modeloTetoEstimativa em 70 %
Granite 4.2 8B5,3 GB127 tokens/scerca de 89 tokens/s
Qwen 3.5 9B6,6 GB102 tokens/saproximadamente 71 tokens/s
Gemma 4 12B7,7 GB87 tokens/saproximadamente 61 tokens/s
Mistral Small 24B14 GB48 tokens/saproximadamente 34 tokens/s

gpt-oss 20B é um modelo de especialistas: ele lê apenas parte de seus pesos por token, portanto sua taxa de geração supera a de um modelo denso de 14 GB. Nenhum valor respaldado por uma fonte é reproduzido aqui. Lembre-se sobretudo de que a placa passa de rápida com um 8B a satisfatória com um 24B.

#4070 Ti Super frente à 4080 Super e à 5070 Ti

Placas de 16 GB para comparar
PlacaVRAMLargura de bandaObservação
RTX 4070 Ti Super16 GB GDDR6X672 GB/sMesmo chip AD103 que a 4080
RTX 4080 Super16 GB GDDR6X736 GB/sAproximadamente 10 % a mais de largura de banda
RTX 5070 Ti16 GB GDDR7896 GB/s33 % a mais de largura de banda

As três placas oferecem 16 GB: a capacidade é a mesma, portanto a lista de modelos também. Apenas a velocidade de geração muda, proporcionalmente à largura de banda. A 4080 Super ganha cerca de 10%; a 5070 Ti, cerca de um terço. No mercado de usados, a diferença de preço conta mais do que essas diferenças na taxa de geração: consulte o acompanhamento de preços para comparar. Uma 4070 Ti Super usada a um bom preço continua sendo uma excelente escolha; uma 5070 Ti nova se justifica pela garantia e pela velocidade.

#Usos que se beneficiam dos 16 GB

Os 16 GB mudam principalmente o que é possível rodar ao mesmo tempo. Um RAG local combina um modelo de geração, um modelo de embeddings e um contexto bastante longo para conter os trechos encontrados: com Gemma 4 12B (7,7 a 8 GB) e um pequeno modelo de embeddings, o conjunto cabe com vários gigabytes de margem. Um assistente de código precisa apenas de um modelo de 8B a 12B e de um contexto de 16.000 tokens, sem nenhuma restrição. Um modelo de 14 GB como Mistral Small 24B ocupa quase toda a placa: torna-se uma escolha exclusiva, não um modelo entre outros.

Três configurações típicas em 16 GB
UsoConfiguraçãoEspaço restante
RAG pessoalGemma 4 12B e modelo de embeddings leveAproximadamente 7 GB para o contexto
Assistente de códigoModelo de 8B, contexto de 16.000 tokens, cache q8_0Aproximadamente 9 GB
Chat de qualidade máximaApenas Mistral Small 24BAproximadamente 2 GB, contexto curto

Uma armadilha no uso compartilhado: no Ollama, várias requisições em paralelo ao mesmo modelo aumentam proporcionalmente o tamanho do contexto reservado. Atender três colegas com um modelo de 14 GB pode, portanto, exceder a memória da placa, enquanto um único usuário consegue usá-lo sem dificuldade. Com 16 GB, limite o paralelismo ou escolha um modelo mais leve para uso compartilhado.

#Comprar uma 4070 Ti Super de segunda mão: o que deve ser verificado

A placa foi lançada em janeiro de 2024: a maioria das unidades usadas tem menos de três anos, mas não há garantia quanto ao uso anterior delas. Os preços mudam a cada semana: consulte o acompanhamento de preços em vez de um valor fixo neste guia. Antes de comprar, verifique se nvidia-smi realmente mostra 16 GB de memória, execute um modelo de 14 GB, monitore a temperatura durante uma geração longa e ouça as ventoinhas. Peça a nota fiscal e a garantia restante do fabricante: elas costumam ser transferidas junto com a placa.

#Veredito 2026

Mantenha-a se
Seus modelos cabem em 16 GB. Nada justifica substituir a placa antes de você precisar de 24 GB.
Compre-a usada se
O preço é consideravelmente inferior ao de uma 5070 Ti nova. Verifique a garantia restante, a temperatura e o barulho dos ventiladores.
Busque 24 GB se
Você quer Qwen 3.5 27B ou mais: nenhum ajuste fará entrar 17 GB em 16 GB com contexto, e uma placa de 24 GB evita a necessidade de comprar novamente.

#Perguntas frequentes

FAQ
A RTX 4070 Ti Super consegue rodar Mistral Small 24B?+
Sim: o modelo pesa 14 GB de acordo com Ollama, a placa tem 16 GB. Restam cerca de 2 GB para o contexto e o sistema. O contexto padrão de 4 096 tokens funciona; para 16 000 tokens, ative o Flash Attention e o cache K/V em q8_0 para reduzir o uso de memória do cache em cerca de metade.
Qual a diferença entre RTX 4070 Ti e 4070 Ti Super para um LLM?+
A Ti Super tem 16 GB de memória em um barramento de 256 bits, a Ti apenas 12 GB em 192 bits. A largura de banda passa de 504 GB/s para 672 GB/s de acordo com a Wikipedia. Para um LLM, a capacidade é mais importante: a Ti Super carrega modelos de 14 GB que a Ti não consegue alocar.
RTX 4070 Ti Super ou RTX 5070 Ti?+
As duas têm 16 GB, portanto rodam os mesmos modelos. A 5070 Ti lê sua memória a 896 GB/s contra 672 GB/s, ou seja, cerca de um terço a mais. Ela é mais rápida e é vendida nova, com garantia; a 4070 Ti Super se justifica principalmente se seu preço no mercado de usados for significativamente menor.
A RTX 4070 Ti Super ou a 4080 para um LLM?+
Ambas têm 16 GB de VRAM. A 4080 Super tem 736 GB/s de largura de banda contra 672 GB/s, ou seja, cerca de 10% a mais, e a 4080 clássica tem 716,8 GB/s. Para o LLM, a diferença é modesta: a diferença de preço no mercado de usados deve decidir, não a ficha técnica.
Qual fonte de alimentação é necessária para uma RTX 4070 Ti Super?+
A NVIDIA indica 285 W de potência gráfica total e uma fonte de alimentação de no mínimo 700 W para o PC inteiro. Uma fonte de alimentação de qualidade de 750 W deixa uma margem confortável. Verifique também os conectores: a placa exige dois cabos PCIe de 8 pinos ou um cabo PCIe Gen 5 de 300 W ou mais.
É possível rodar o Qwen 3.5 27B em uma RTX 4070 Ti Super?+
Não completamente na VRAM: o modelo pesa 17 GB segundo o Ollama, e a placa tem 16 GB. Uma parte seria lida da RAM do sistema, o que torna a geração significativamente mais lenta. Para este modelo, busque 24 GB de VRAM; com 16 GB, escolha um modelo de 14 GB ou menos.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.