RTX 5070 Ti (16 GB) para LLM local: modelos e tokens/s
Todos nós nos perguntamos como equilibrar VRAM, velocidade e custo. A RTX 5070 Ti se posiciona exatamente no meio da linha Blackwell: 16 GB de GDDR7, em torno de 1.400 € no final de setembro de 2026, com um TGP razoável. A verdadeira pergunta que fazemos sobre a RTX 5070 Ti para LLMs locais é: será que essa placa dá conta dos modelos relevantes em 2026 — GLM 4.7 Flash (MoE 30B-A3B), gpt-oss 20B, Qwen 3.8 27B — sem que nos arrependamos de não ter escolhido a 5080 ou a 5090?
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Para este setup: RTX 5070 Ti 16 GB.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que a 5070 Ti?
O mercado de GPUs em 2026 está muito bem segmentado: a 5060 Ti 16 GB é lenta em prompts grandes, a 5080 custa aproximadamente 450 € a mais para a mesma VRAM e a 5090 continua sendo um investimento profissional em torno de 5.700 € no final de setembro de 2026. Entre as duas, a 5070 Ti ocupa o lugar que a 4070 Ti Super ocupava um ano atrás: 16 GB de VRAM, uma largura de banda de memória confortável e um preço que ainda cabe no orçamento de quem investe seriamente em um hobby.
Para um LLM local, o que importa antes de tudo é a VRAM (quanto do modelo cabe na memória) e a largura de banda da memória (a velocidade com que os pesos são lidos para gerar cada token). A 5070 Ti atende às duas exigências sem grandes concessões.
#Do que a placa é capaz
- VRAM
- 16 GB GDDR7 — a mesma quantidade da 5080, metade da 5090, mas principalmente: GDDR7 e não GDDR6X. O ganho de largura de banda em comparação com a geração anterior é significativo.
- Largura de banda da memória
- Aproximadamente 896 GB/s. Como referência: 504 GB/s na 4070 Ti Super, 960 GB/s na 5080, 1792 GB/s na 5090. A 5070 Ti está mais próxima da 5080 do que da 4070 Ti Super.
- Compute
- Arquitetura Blackwell, Tensor Cores 5ª geração com suporte ao FP4. A maioria dos motores de inferência (llama.cpp, vLLM) ainda não os explora em 2026, mas isso está em andamento.
- TGP
- 300 W de TGP nominal. Conector 12V-2x6 (fonte ATX 3.0/3.1 fortemente recomendada).
- PCIe
- PCIe 5.0 x16. Não crítico para a inferência local (o modelo permanece na VRAM), útil para carregamentos e multi-GPU.
- Preço observado
- Entre 880 e 1.050 € para modelos personalizados em junho de 2026. A FE não existe nessa referência.
#Requisitos da máquina
Nada exótico, mas alguns pontos devem ser validados antes de investir.
- Alimentação
- 750 W mínimo, 850 W recomendados se o processador for potente. ATX 3.0/3.1 com conector nativo 12V-2x6 é o ideal — um adaptador de 4x8 pinos funciona, mas continua sendo uma fonte de problemas.
- CPU
- Qualquer Ryzen 7000/9000 ou Intel de 13ª/14ª geração é mais do que suficiente. A CPU não faz nenhum trabalho durante a inferência na GPU: rodamos os benchmarks em um 7700X sem gargalos.
- RAM do sistema
- 32 GB de DDR5 são suficientes para trabalhar com folga. Se você planeja transferir para a RAM parte de modelos com mais de 16 GB (DeepSeek V3.2, Kimi K2), aumente para 64 ou 128 GB.
- OS
- Windows 11 24H2 e Ubuntu 24.04 LTS suportam o driver 580.x sem problemas. Driver NVIDIA Studio (Windows) ou o driver de produção (Linux) — não é necessário o Game Ready para Ollama.
#Instalação do Ollama + driver
- 01Instalar o driver NVIDIA 580.x ou mais recenteNo Windows: no NVIDIA App, escolher o driver Studio. No Linux: sudo ubuntu-drivers install --gpgpu para Ubuntu, ou o runfile oficial. Verifique com nvidia-smi se a placa e a VRAM aparecem corretamente.
- 02Instalar OllamaBaixe do ollama.com (instalador Windows ou comando Linux). O daemon escuta por padrão em http://localhost:11434 e detecta automaticamente a 5070 Ti via CUDA.
- 03Verificar se a GPU está realmente sendo utilizadaExecutar ollama run qwen3.5:9b e depois monitorar nvidia-smi dmon -s u em um terminal separado. A coluna sm (uso de computação) deve atingir 60–95% durante a geração.
- 04Ajustar o contextoPor padrão, o Ollama carrega um contexto de 4096 tokens. Em 16 GB, é possível aumentar para 16k ou 32k em modelos de 8B sem problemas. Variável OLLAMA_CONTEXT_LENGTH ou parâmetro num_ctx na API.
#Tokens por segundo em 8B e 14B
Modelos que cabem com folga mesmo com um contexto grande. Medições feitas com um prompt de 512 tokens e 256 tokens gerados, com média de 5 execuções.
- Qwen 3.5 9B Q4_K_M
- Aproximadamente 90 tok/s na geração, processamento de prompt a 2.800 tok/s. VRAM utilizada: 6,6 GB. Restam 9 GB para o contexto — uma margem confortável para 32k, e o modelo chega a uma janela de até 256k (com visão incluída).
- Granite 4.2 8B Q4_K_M
- Cerca de 94 tok/s. VRAM utilizada: 5,3 GB, muito eficiente em termos de tokens e com 128k de contexto. Uma alternativa ao Qwen que consome poucos recursos para quem quer a máxima taxa de geração.
- Gemma 4 12B Q4_K_M
- Aproximadamente 62 tok/s. VRAM utilizada: 7,6 GB. É o ponto ideal da faixa intermediária, com bastante folga na placa: sobram 8 GB para o contexto e o cache KV, e Gemma 4 é multimodal (Apache 2.0 desde abril de 2026).
- Qwen 3.5 9B Q8_0
- Aproximadamente 48 tok/s. VRAM utilizada: 11 GB. A qualidade máxima dessa faixa: o mesmo 9B, mas em Q8, quando você quer a melhor qualidade de saída sem mudar de modelo.
- Mistral Small 24B Q4_K_M
- Aproximadamente 36 tok/s. VRAM utilizada: 14,2 GB. Funciona: é um modelo generalista sólido e bom em francês, mas o contexto é limitado a 8k sem offload — o limite de 16 GB começa a pesar.
#O caso GLM 4.7 Flash (MoE 30B-A3B)
É aqui que a 5070 Ti se torna especialmente interessante em 2026. GLM 4.7 Flash é um modelo Mixture-of-Experts: 30 bilhões de parâmetros ao todo, mas apenas 3 bilhões ativados por token (arquitetura 30B-A3B, licença MIT, muito bom em agentes). A VRAM total necessária permanece a do modelo completo, mas a velocidade de inferência é próxima da de um 3B denso.
- GLM 4.7 Flash Q4_K_M
- Aproximadamente 78 tok/s em geração. VRAM utilizada: 18,4 GB — sim, isso excede a capacidade da VRAM. O Ollama transfere automaticamente 2 GB para a RAM do sistema, o que reduz a velocidade real observada para 64 tok/s na prática.
- GLM 4.7 Flash Q3_K_M
- Aproximadamente 71 tok/s. VRAM utilizada: 14,8 GB. Tudo cabe na VRAM, com possibilidade de contexto de 16k. A perda de qualidade em comparação com o Q4 é baixa (≈1-2 % nos benchmarks públicos).
- gpt-oss 20B (MXFP4)
- Cerca de 96 tok/s. VRAM utilizada: 14 GB. O modelo de pesos abertos da OpenAI, muito rápido graças à sua quantização MXFP4 nativa e com 131k de contexto — cabe por pouco nos 16 GB com um contexto moderado.
Veredito MoE: o Q3_K_M é um bom equilíbrio nessa placa para o GLM 4.7 Flash. Mantemos a qualidade de um 30B com a velocidade de um 3B, e tudo permanece na VRAM.
#Aumentar para 27-30B: Qwen 3.8 e Granite 4.2
Os grandes modelos densos e profissionais na faixa de 27–30B são o limite razoável da placa. Acima disso, entra-se no território do offload massivo.
- Qwen 3.8 27B Q4_K_M
- Aproximadamente 24 tok/s em geração com offload de 2 a 3 GB para a RAM. VRAM utilizada: 16 GB totalmente ocupados + um pouco de RAM. Lançado em 14/08/2026, 262k de contexto e visão: é o modelo "próximo ao Copilot" da faixa. Tende a pensar demais com sua configuração padrão de raciocínio — mude para low para respostas mais diretas.
- Qwen 3.8 27B Q3_K_M
- Aproximadamente 36 tok/s. VRAM utilizada: 14 GB, com o modelo inteiramente na VRAM. Um bom equilíbrio se você quiser usar esse grande modelo denso com fluidez.
- Granite 4.2 30B Q4_K_M
- Aproximadamente 22 tok/s com offload. VRAM utilizada: 18 GB. Voltado ao uso profissional/empresarial, com perfil quase idêntico ao do Qwen 3.8 27B.
- Nemotron 3.5 Lightning 30B Q4_K_M
- Não cabe: 25 GB em Q4, exige offload de grande parte do modelo para a RAM ou o SSD, com velocidade de cerca de 3 tok/s — não é uma opção utilizável no dia a dia com 16 GB (nem mesmo com 24 GB).
#Preço em comparação com 5080 e 5090
O cálculo bruto de preço / tokens por segundo. Não é perfeito (desconsidera a amortização e a eletricidade), mas coloca as ordens de grandeza em perspectiva.
- RTX 5070 Ti (≈ 1 400 € no final de setembro de 2026)
- Em Gemma 4 12B: ≈ 22,5 €/(tok/s). Em GLM 4.7 Flash Q3: ≈ 19,8 €/(tok/s). Em Qwen 3.8 27B Q3: ≈ 38,9 €/(tok/s).
- RTX 5080 (≈ 1 850 € no final de setembro de 2026)
- Em Gemma 4 12B: ≈ 25,8 €/(tok/s). Em GLM 4.7 Flash Q3: ≈ 22,6 €/(tok/s). Ganho real na velocidade (+15 a 20%) mas custo superior.
- RTX 5090 (≈ 5 700 € no fim de setembro de 2026)
- Em Gemma 4 12B: ≈ 67,0 €/(tok/s). Em Qwen 3.8 27B Q4: ≈ 104,5 €/(tok/s). Só se torna competitiva quando se busca 70B+, o que não é viável em 16 GB.
- RTX 4070 Ti Super 16 GB (usada, preço variável)
- Com Gemma 4 12B: 15,3 €/(tok/s). Mais barata, mas cerca de 25% mais lenta nos modelos MoE devido à memória GDDR6X mais lenta. Continua sendo uma opção relevante no mercado de usados.
- RTX 3090 de segunda mão (de segunda mão, preço variável)
- Para Gemma 4 12B, 24 GB de VRAM com preço variável no mercado de usados. Relação desempenho/euro atraente se você aceitar uma placa Ampere usada e o consumo de 350 W.
A 5070 Ti não oferece a melhor relação entre preço em euros e desempenho — a 3090 usada continua à frente. Ela se torna uma boa escolha quando você quer uma placa nova, com garantia, consumo moderado e suporte a FP4 para o futuro.
#Consumo e comportamento térmico
Medidas na instalação, máquina completa, alimentação 850 W Gold, GPU apenas em piloto, tela desligada.
- Em repouso (modelo carregado, sem geração)
- A máquina consome 75 W no total, dos quais cerca de 15 W correspondem à GPU. Muito eficiente, a inferência em espera não pesa na sua conta.
- Inferência 8B Q4
- Pico de 195 W medidos na tomada (GPU ~145 W). A placa não chega ao máximo — a memória GDDR7 satura antes da capacidade de processamento, como na 5090.
- Inferência 12B Q4
- Pico de 245 W na tomada (GPU ~190 W). Equilíbrio ideal entre consumo e utilidade.
- Inferência MoE 30B-A3B
- Pico de 280 W na tomada (GPU ~225 W). O MoE aquece menos que o equivalente denso.
- Processamento de prompt em lote de 4096 tokens
- Pico de 360 W medido na tomada (GPU ~298 W). É o momento em que a capacidade de processamento saturada leva a placa para perto de seu TGP nominal de 300 W.
- Temperatura máxima do GPU
- 72 °C em carga contínua, ventiladores em torno de 1.600 rpm. Modelo personalizado com três ventiladores — mais silencioso do que a 5090.
#Veredito: ponto ideal ou não?
- Para quem é a compra certa
- Você quer uma placa nova, pretende rodar principalmente modelos de 8B-12B com algumas incursões nos 30B MoE e nos 27-30B densos em Q3. Você valoriza uma placa silenciosa e com consumo razoável. Esse é o perfil para o qual a 5070 Ti foi feita.
- Quando escolher a 5080 em vez dela
- Se você roda diariamente modelos de 27-30B densos em Q4 e os 16 GB cheios o incomodam. A 5080 tem a mesma VRAM, mas uma largura de banda 7% maior — ganho modesto por aproximadamente 450 € a mais.
- Quando almejar a 5090
- Se você busca um modelo 70B+ em Q4 localmente ou fine-tuning LoRA em modelos 13B+. 16 GB não são suficientes nem para um nem para o outro.
- Quando preferir uma 3090 de segunda mão
- Orçamento apertado, disposição para usar hardware usado, necessidade dos 24 GB para modelos de 27 a 30B em Q5 ou para começar a rodar modelos de 70B com offload leve. Você perde o suporte ao FP4, mas a economia obtida continua sendo substancial (a avaliar conforme o preço dos equipamentos usados no momento).
- Quando preferir uma 4070 Ti Super
- Se você encontrar uma usada a um preço interessante (variável conforme o mercado) e um modelo de 12B for suficiente para seu caso de uso. Desempenho muito próximo na prática, por muito menos.
#Para se aprofundar
Três leituras úteis para se aprofundar:
- Escolher bem a quantização
- O guia 'Escolher a quantização (Q4, Q5, Q8, FP16)' detalha por que o Q3_K_M se torna relevante com 16 GB quando o objetivo é usar modelos de 30B ou mais.
- Ampliar a comparação
- O guia "Escolher a GPU para IA local" amplia o panorama além da linha Blackwell, o que é útil se você ainda estiver em dúvida.
- Aprofundar o conhecimento sobre um modelo MoE
- O guia "Llama 4 Scout em execução local" detalha o funcionamento do MoE, especialmente adequado para uma placa de 16 GB como a 5070 Ti.
Os preços mudam rápido: nosso monitoramento registra toda segunda e quinta-feira o menor preço das placas de vídeo para IA local, com o preço por GB de VRAM.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.