Iniciante 11 minGPU

RTX 5070 Ti (16 GB) para LLM local: modelos e tokens/s

Todos nós nos perguntamos como equilibrar VRAM, velocidade e custo. A RTX 5070 Ti se posiciona exatamente no meio da linha Blackwell: 16 GB de GDDR7, em torno de 1.400 € no final de setembro de 2026, com um TGP razoável. A verdadeira pergunta que fazemos sobre a RTX 5070 Ti para LLMs locais é: será que essa placa dá conta dos modelos relevantes em 2026 — GLM 4.7 Flash (MoE 30B-A3B), gpt-oss 20B, Qwen 3.8 27B — sem que nos arrependamos de não ter escolhido a 5080 ou a 5090?

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Para este setup: RTX 5070 Ti 16 GB.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Por que a 5070 Ti?

O mercado de GPUs em 2026 está muito bem segmentado: a 5060 Ti 16 GB é lenta em prompts grandes, a 5080 custa aproximadamente 450 € a mais para a mesma VRAM e a 5090 continua sendo um investimento profissional em torno de 5.700 € no final de setembro de 2026. Entre as duas, a 5070 Ti ocupa o lugar que a 4070 Ti Super ocupava um ano atrás: 16 GB de VRAM, uma largura de banda de memória confortável e um preço que ainda cabe no orçamento de quem investe seriamente em um hobby.

Para um LLM local, o que importa antes de tudo é a VRAM (quanto do modelo cabe na memória) e a largura de banda da memória (a velocidade com que os pesos são lidos para gerar cada token). A 5070 Ti atende às duas exigências sem grandes concessões.

i
O que esse guia testa
Qwen 3.5 9B Q4_K_M, Granite 4.2 8B Q4_K_M, Gemma 4 12B Q4_K_M, GLM 4.7 Flash (MoE 30B-A3B) em Q4_K_M e Q3_K_M, gpt-oss 20B (MXFP4) e Qwen 3.8 27B Q4_K_M. Todos via Ollama 0.7, driver NVIDIA 580.x, Windows 11 e Ubuntu 24.04.

#Do que a placa é capaz

VRAM
16 GB GDDR7 — a mesma quantidade da 5080, metade da 5090, mas principalmente: GDDR7 e não GDDR6X. O ganho de largura de banda em comparação com a geração anterior é significativo.
Largura de banda da memória
Aproximadamente 896 GB/s. Como referência: 504 GB/s na 4070 Ti Super, 960 GB/s na 5080, 1792 GB/s na 5090. A 5070 Ti está mais próxima da 5080 do que da 4070 Ti Super.
Compute
Arquitetura Blackwell, Tensor Cores 5ª geração com suporte ao FP4. A maioria dos motores de inferência (llama.cpp, vLLM) ainda não os explora em 2026, mas isso está em andamento.
TGP
300 W de TGP nominal. Conector 12V-2x6 (fonte ATX 3.0/3.1 fortemente recomendada).
PCIe
PCIe 5.0 x16. Não crítico para a inferência local (o modelo permanece na VRAM), útil para carregamentos e multi-GPU.
Preço observado
Entre 880 e 1.050 € para modelos personalizados em junho de 2026. A FE não existe nessa referência.

#Requisitos da máquina

Nada exótico, mas alguns pontos devem ser validados antes de investir.

Alimentação
750 W mínimo, 850 W recomendados se o processador for potente. ATX 3.0/3.1 com conector nativo 12V-2x6 é o ideal — um adaptador de 4x8 pinos funciona, mas continua sendo uma fonte de problemas.
CPU
Qualquer Ryzen 7000/9000 ou Intel de 13ª/14ª geração é mais do que suficiente. A CPU não faz nenhum trabalho durante a inferência na GPU: rodamos os benchmarks em um 7700X sem gargalos.
RAM do sistema
32 GB de DDR5 são suficientes para trabalhar com folga. Se você planeja transferir para a RAM parte de modelos com mais de 16 GB (DeepSeek V3.2, Kimi K2), aumente para 64 ou 128 GB.
OS
Windows 11 24H2 e Ubuntu 24.04 LTS suportam o driver 580.x sem problemas. Driver NVIDIA Studio (Windows) ou o driver de produção (Linux) — não é necessário o Game Ready para Ollama.
!
Conector 12V-2x6
Como nas 5090 e 4090, o conector de alimentação deve ser encaixado completamente, até fazer um clique. Vários casos de conectores derretidos foram relatados no início de 2026 em cabos de terceiros não certificados. Use o cabo fornecido com a fonte ou um cabo PCIe 5.1 certificado.

#Instalação do Ollama + driver

  1. 01
    Instalar o driver NVIDIA 580.x ou mais recente
    No Windows: no NVIDIA App, escolher o driver Studio. No Linux: sudo ubuntu-drivers install --gpgpu para Ubuntu, ou o runfile oficial. Verifique com nvidia-smi se a placa e a VRAM aparecem corretamente.
  2. 02
    Instalar Ollama
    Baixe do ollama.com (instalador Windows ou comando Linux). O daemon escuta por padrão em http://localhost:11434 e detecta automaticamente a 5070 Ti via CUDA.
  3. 03
    Verificar se a GPU está realmente sendo utilizada
    Executar ollama run qwen3.5:9b e depois monitorar nvidia-smi dmon -s u em um terminal separado. A coluna sm (uso de computação) deve atingir 60–95% durante a geração.
  4. 04
    Ajustar o contexto
    Por padrão, o Ollama carrega um contexto de 4096 tokens. Em 16 GB, é possível aumentar para 16k ou 32k em modelos de 8B sem problemas. Variável OLLAMA_CONTEXT_LENGTH ou parâmetro num_ctx na API.
Verificar a detecção da GPU
ollama ps
# Doit afficher la colonne PROCESSOR à 100% GPU

nvidia-smi --query-gpu=name,memory.total,memory.used,utilization.gpu --format=csv
# Doit montrer une RTX 5070 Ti avec ~16 Go total

#Tokens por segundo em 8B e 14B

Modelos que cabem com folga mesmo com um contexto grande. Medições feitas com um prompt de 512 tokens e 256 tokens gerados, com média de 5 execuções.

Qwen 3.5 9B Q4_K_M
Aproximadamente 90 tok/s na geração, processamento de prompt a 2.800 tok/s. VRAM utilizada: 6,6 GB. Restam 9 GB para o contexto — uma margem confortável para 32k, e o modelo chega a uma janela de até 256k (com visão incluída).
Granite 4.2 8B Q4_K_M
Cerca de 94 tok/s. VRAM utilizada: 5,3 GB, muito eficiente em termos de tokens e com 128k de contexto. Uma alternativa ao Qwen que consome poucos recursos para quem quer a máxima taxa de geração.
Gemma 4 12B Q4_K_M
Aproximadamente 62 tok/s. VRAM utilizada: 7,6 GB. É o ponto ideal da faixa intermediária, com bastante folga na placa: sobram 8 GB para o contexto e o cache KV, e Gemma 4 é multimodal (Apache 2.0 desde abril de 2026).
Qwen 3.5 9B Q8_0
Aproximadamente 48 tok/s. VRAM utilizada: 11 GB. A qualidade máxima dessa faixa: o mesmo 9B, mas em Q8, quando você quer a melhor qualidade de saída sem mudar de modelo.
Mistral Small 24B Q4_K_M
Aproximadamente 36 tok/s. VRAM utilizada: 14,2 GB. Funciona: é um modelo generalista sólido e bom em francês, mas o contexto é limitado a 8k sem offload — o limite de 16 GB começa a pesar.
→
Como interpretar o número
Acima de 30 tok/s, a velocidade supera o que um ser humano consegue ler confortavelmente. Abaixo de 15 tok/s, a espera é perceptível. A 5070 Ti mantém toda a faixa de 8B a 12B em uma velocidade confortável e permite usar o 24B em uma velocidade viável.

#O caso GLM 4.7 Flash (MoE 30B-A3B)

É aqui que a 5070 Ti se torna especialmente interessante em 2026. GLM 4.7 Flash é um modelo Mixture-of-Experts: 30 bilhões de parâmetros ao todo, mas apenas 3 bilhões ativados por token (arquitetura 30B-A3B, licença MIT, muito bom em agentes). A VRAM total necessária permanece a do modelo completo, mas a velocidade de inferência é próxima da de um 3B denso.

GLM 4.7 Flash Q4_K_M
Aproximadamente 78 tok/s em geração. VRAM utilizada: 18,4 GB — sim, isso excede a capacidade da VRAM. O Ollama transfere automaticamente 2 GB para a RAM do sistema, o que reduz a velocidade real observada para 64 tok/s na prática.
GLM 4.7 Flash Q3_K_M
Aproximadamente 71 tok/s. VRAM utilizada: 14,8 GB. Tudo cabe na VRAM, com possibilidade de contexto de 16k. A perda de qualidade em comparação com o Q4 é baixa (≈1-2 % nos benchmarks públicos).
gpt-oss 20B (MXFP4)
Cerca de 96 tok/s. VRAM utilizada: 14 GB. O modelo de pesos abertos da OpenAI, muito rápido graças à sua quantização MXFP4 nativa e com 131k de contexto — cabe por pouco nos 16 GB com um contexto moderado.

Veredito MoE: o Q3_K_M é um bom equilíbrio nessa placa para o GLM 4.7 Flash. Mantemos a qualidade de um 30B com a velocidade de um 3B, e tudo permanece na VRAM.

#Aumentar para 27-30B: Qwen 3.8 e Granite 4.2

Os grandes modelos densos e profissionais na faixa de 27–30B são o limite razoável da placa. Acima disso, entra-se no território do offload massivo.

Qwen 3.8 27B Q4_K_M
Aproximadamente 24 tok/s em geração com offload de 2 a 3 GB para a RAM. VRAM utilizada: 16 GB totalmente ocupados + um pouco de RAM. Lançado em 14/08/2026, 262k de contexto e visão: é o modelo "próximo ao Copilot" da faixa. Tende a pensar demais com sua configuração padrão de raciocínio — mude para low para respostas mais diretas.
Qwen 3.8 27B Q3_K_M
Aproximadamente 36 tok/s. VRAM utilizada: 14 GB, com o modelo inteiramente na VRAM. Um bom equilíbrio se você quiser usar esse grande modelo denso com fluidez.
Granite 4.2 30B Q4_K_M
Aproximadamente 22 tok/s com offload. VRAM utilizada: 18 GB. Voltado ao uso profissional/empresarial, com perfil quase idêntico ao do Qwen 3.8 27B.
Nemotron 3.5 Lightning 30B Q4_K_M
Não cabe: 25 GB em Q4, exige offload de grande parte do modelo para a RAM ou o SSD, com velocidade de cerca de 3 tok/s — não é uma opção utilizável no dia a dia com 16 GB (nem mesmo com 24 GB).
i
Q3_K_M ou Q4_K_M ?
Nos modelos de 27–30B, a diferença de qualidade entre Q4_K_M e Q3_K_M continua pequena (geralmente 2–3% no MMLU). Em uma placa de 16 GB, o Q3_K_M mantém tudo na VRAM e quase triplica a velocidade. É a escolha adequada para essa configuração.

#Preço em comparação com 5080 e 5090

O cálculo bruto de preço / tokens por segundo. Não é perfeito (desconsidera a amortização e a eletricidade), mas coloca as ordens de grandeza em perspectiva.

RTX 5070 Ti (≈ 1 400 € no final de setembro de 2026)
Em Gemma 4 12B: ≈ 22,5 €/(tok/s). Em GLM 4.7 Flash Q3: ≈ 19,8 €/(tok/s). Em Qwen 3.8 27B Q3: ≈ 38,9 €/(tok/s).
RTX 5080 (≈ 1 850 € no final de setembro de 2026)
Em Gemma 4 12B: ≈ 25,8 €/(tok/s). Em GLM 4.7 Flash Q3: ≈ 22,6 €/(tok/s). Ganho real na velocidade (+15 a 20%) mas custo superior.
RTX 5090 (≈ 5 700 € no fim de setembro de 2026)
Em Gemma 4 12B: ≈ 67,0 €/(tok/s). Em Qwen 3.8 27B Q4: ≈ 104,5 €/(tok/s). Só se torna competitiva quando se busca 70B+, o que não é viável em 16 GB.
RTX 4070 Ti Super 16 GB (usada, preço variável)
Com Gemma 4 12B: 15,3 €/(tok/s). Mais barata, mas cerca de 25% mais lenta nos modelos MoE devido à memória GDDR6X mais lenta. Continua sendo uma opção relevante no mercado de usados.
RTX 3090 de segunda mão (de segunda mão, preço variável)
Para Gemma 4 12B, 24 GB de VRAM com preço variável no mercado de usados. Relação desempenho/euro atraente se você aceitar uma placa Ampere usada e o consumo de 350 W.

A 5070 Ti não oferece a melhor relação entre preço em euros e desempenho — a 3090 usada continua à frente. Ela se torna uma boa escolha quando você quer uma placa nova, com garantia, consumo moderado e suporte a FP4 para o futuro.

#Consumo e comportamento térmico

Medidas na instalação, máquina completa, alimentação 850 W Gold, GPU apenas em piloto, tela desligada.

Em repouso (modelo carregado, sem geração)
A máquina consome 75 W no total, dos quais cerca de 15 W correspondem à GPU. Muito eficiente, a inferência em espera não pesa na sua conta.
Inferência 8B Q4
Pico de 195 W medidos na tomada (GPU ~145 W). A placa não chega ao máximo — a memória GDDR7 satura antes da capacidade de processamento, como na 5090.
Inferência 12B Q4
Pico de 245 W na tomada (GPU ~190 W). Equilíbrio ideal entre consumo e utilidade.
Inferência MoE 30B-A3B
Pico de 280 W na tomada (GPU ~225 W). O MoE aquece menos que o equivalente denso.
Processamento de prompt em lote de 4096 tokens
Pico de 360 W medido na tomada (GPU ~298 W). É o momento em que a capacidade de processamento saturada leva a placa para perto de seu TGP nominal de 300 W.
Temperatura máxima do GPU
72 °C em carga contínua, ventiladores em torno de 1.600 rpm. Modelo personalizado com três ventiladores — mais silencioso do que a 5090.
→
Limitar o consumo
nvidia-smi -pl 230 limita a placa a 230 W. Com Gemma 4 12B Q4, perde-se ~4 % de velocidade de geração (62 → 60 tok/s) para economizar ~60 W. Interessante para uso 24/7 ou se a fonte de alimentação tiver pouca margem.

#Veredito: ponto ideal ou não?

Para quem é a compra certa
Você quer uma placa nova, pretende rodar principalmente modelos de 8B-12B com algumas incursões nos 30B MoE e nos 27-30B densos em Q3. Você valoriza uma placa silenciosa e com consumo razoável. Esse é o perfil para o qual a 5070 Ti foi feita.
Quando escolher a 5080 em vez dela
Se você roda diariamente modelos de 27-30B densos em Q4 e os 16 GB cheios o incomodam. A 5080 tem a mesma VRAM, mas uma largura de banda 7% maior — ganho modesto por aproximadamente 450 € a mais.
Quando almejar a 5090
Se você busca um modelo 70B+ em Q4 localmente ou fine-tuning LoRA em modelos 13B+. 16 GB não são suficientes nem para um nem para o outro.
Quando preferir uma 3090 de segunda mão
Orçamento apertado, disposição para usar hardware usado, necessidade dos 24 GB para modelos de 27 a 30B em Q5 ou para começar a rodar modelos de 70B com offload leve. Você perde o suporte ao FP4, mas a economia obtida continua sendo substancial (a avaliar conforme o preço dos equipamentos usados no momento).
Quando preferir uma 4070 Ti Super
Se você encontrar uma usada a um preço interessante (variável conforme o mercado) e um modelo de 12B for suficiente para seu caso de uso. Desempenho muito próximo na prática, por muito menos.
i
O veredito em uma frase
Para rodar LLMs localmente em 2026, sim, a RTX 5070 Ti é uma opção ideal — desde que você aceite que os 16 GB impedem o uso de modelos de 70B e que o grande atrativo dessa placa é rodar confortavelmente um modelo multimodal de 12B e um 30B-MoE em Q3/Q4.

#Para se aprofundar

Três leituras úteis para se aprofundar:

Escolher bem a quantização
O guia 'Escolher a quantização (Q4, Q5, Q8, FP16)' detalha por que o Q3_K_M se torna relevante com 16 GB quando o objetivo é usar modelos de 30B ou mais.
Ampliar a comparação
O guia "Escolher a GPU para IA local" amplia o panorama além da linha Blackwell, o que é útil se você ainda estiver em dúvida.
Aprofundar o conhecimento sobre um modelo MoE
O guia "Llama 4 Scout em execução local" detalha o funcionamento do MoE, especialmente adequado para uma placa de 16 GB como a 5070 Ti.

Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.