Intermediário 11 minRTX 30

Qual LLM para RTX 3080 / 3080 Ti (10-12 GB) ?

Resposta direta

Para um LLM local, uma RTX 3080 ou 3080 Ti de 12 GB executa Qwen 3.5 9B em Q8 (10 GB) e Gemma 4 12B em Q4 (7 GB) com margem, a cerca de 140 tokens/s em um modelo de 7B: a RTX 3080 de 10 GB atinge 139,7 no teste de llama.cpp. A versão de 10 GB limita-se a modelos de 8-9B em Q4. Nenhuma das três carrega um modelo de 20B em Q4 (13 GB) sem transferir parte dele para a RAM.

Três placas levam o nome RTX 3080: a de 10 GB de setembro de 2020, a de 12 GB de janeiro de 2022 e a 3080 Ti de 12 GB de junho de 2021. Elas têm o mesmo chip, mas não a mesma memória, e é a memória que determina o que você consegue rodar. Este guia se baseia em uma medição pública para a velocidade e nas fichas técnicas oficiais para a capacidade.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux
Hardware recomendado

Opção de compra para este guia: RTX 5080 16 GB.

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Compare todas as opções por orçamento, de 800 a 3 500 € →

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#RTX 3080 e 3080 Ti para um LLM local: as três variantes

Uma RTX 3080 ou uma 3080 Ti com 12 GB roda com conforto um modelo de 12 bilhões de parâmetros em Q4 ou um modelo de 9 bilhões em Q8; a versão com 10 GB limita-se a modelos de 7 a 9 bilhões em Q4. De acordo com o catálogo QuelLLM, Gemma 4 12B pesa 7 GB em Q4 e 9 GB em Q5; Qwen 3.5 9B pesa 6 GB em Q4 e 10 GB em Q8, o que exige pelo menos 12 GB assim que se adiciona contexto. Em termos de velocidade, essas placas estão entre as mais rápidas das gerações anteriores: a 3080 de 10 GB gera 139,7 tokens por segundo em um modelo de 7 bilhões em Q4_0 segundo a tabela pública do llama.cpp, o que equivale a quase o dobro da RTX 3060 de 12 GB (75,6). A escolha de uma RTX 3080 para um LLM depende da memória, nunca da velocidade.

RTX 3080 10 GB
Setembro de 2020, 8.704 núcleos CUDA, 10 GB de GDDR6X em um barramento de 320 bits, ou seja, 760 GB/s. Potência da placa de 320 W.
RTX 3080 12 GB
Janeiro de 2022, 8.960 núcleos, 12 GB de GDDR6X em um barramento de 384 bits, ou seja, 912 GB/s, 350 W. Cerca de 20 % a mais de largura de banda.
RTX 3080 Ti
Junho de 2021, 10.240 núcleos, 12 GB de GDDR6X em um barramento de 384 bits, como na 3080 de 12 GB, portanto uma largura de banda esperada idêntica, 350 W.

O cálculo do limite ajuda a entender: a geração de texto lê os pesos em cada token, então a banda larga define a velocidade máxima. As 3080 12 GB e Ti ganham 20% de banda larga em relação às 10 GB, mas a 3080 Ti adiciona principalmente núcleos de cálculo, que aceleram a leitura do prompt mais do que a geração.

#3080 10 GB, 12 GB ou 3080 Ti: qual escolher

As três RTX 3080
Critério3080 10 GB3080 12 GB3080 Ti 12 GB
Núcleos CUDA8 7048 96010 240
Memória10 GB GDDR6X12 GB GDDR6X12 GB GDDR6X
Barramento / largura de banda320 bits / 760 GB/s384 bits / 912 GB/s384 bits, mesma largura de banda esperada
Potência da placa320 W350 W350 W
Geração com Llama 2 7B Q4_0139,7 tok/s (medida)estimativa: até aproximadamente 167estimativa: próximo ao desempenho da versão de 12 GB

Para IA local, a 3080 Ti e a 3080 de 12 GB são intercambiáveis: os mesmos 12 GB, o mesmo barramento e uma velocidade de geração muito próxima. A estimativa para essas duas placas é um limite superior que aplica à largura de banda de 912 GB/s o rendimento medido da versão de 10 GB: na prática, a 3090, cujo barramento também é de 384 bits, registra 158,2 tokens por segundo. Portanto, escolha a mais barata das duas, sem se deixar guiar pelo número de núcleos. A versão de 10 GB, por sua vez, fica um nível abaixo em capacidade: seus 10 GB não permitem usar modelos de 9 bilhões de parâmetros em Q8.

#Modelos compatíveis de acordo com a memória

O que cabe em 10 GB e em 12 GB (peso conforme o catálogo QuelLLM)
Modelo e quantizaçãoTamanho do modelo3080 10 GB3080 12 GB / Ti
Qwen 3.5 9B em Q46 GBSim, com contextoSim, com muito contexto
Gemma 4 12B em Q47 GBSim, contexto moderadoSim, confortável
Gemma 4 12B em Q59 GBMuito apertadoSim, contexto moderado
Qwen 3.5 9B em Q810 GBNãoSim, mas com pouco contexto
gpt-oss 20B em Q413 GBNãoNão: excede a capacidade em 1 GB

Dois pontos dessa tabela merecem atenção. Primeiro, a 3080 de 10 GB consegue rodar o Gemma 4 12B em Q4 (7 GB), apesar do que se poderia imaginar: restam 3 GB para o contexto, o que é suficiente para conversas de tamanho médio. Em seguida, a diferença entre 12 e 16 GB é clara: um modelo da classe de 20 bilhões de parâmetros em Q4, como gpt-oss 20B, pesa 13 GB e não cabe em nenhuma das três placas. Se esse é o seu objetivo, você precisa de uma placa com 16 GB ou mais, e o guia sobre 12 GB de VRAM detalha exatamente o que se pode fazer com 12 GB.

#Instalação, alimentação e configurações

As RTX 3080 e 3080 Ti estão entre as placas com capacidade de cálculo 8.6 listadas pelo Ollama, que exige um driver 550 ou mais recente. Um ponto de atenção específico dessas placas: a ficha técnica da NVIDIA informa 350 W para a placa, 320 W para a versão de 10 GB e recomenda uma fonte de alimentação de 750 W para o sistema. Verifique sua fonte de alimentação antes de instalar a placa e ligue os conectores da placa a cabos distintos.

  1. 01
    Verificar a fonte de alimentação
    Verifique se a fonte de alimentação chega a 750 W e se possui os conectores exigidos pelo modelo da sua placa.
  2. 02
    Instalar o driver e Ollama
    Instale um driver 550 ou mais recente, depois o Ollama, e inicie um modelo de sua escolha.
  3. 03
    Ajustar a memória
    Na versão de 10 GB, inicie o servidor com OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0: a documentação especifica que o cache K/V pode ser quantizado quando o Flash Attention está ativado.
  4. 04
    Verificar
    Com o nvidia-smi, monitore a memória e a temperatura sob carga: essas placas aquecem mais do que os modelos recentes.
Linux: iniciar Ollama com configurações de memória
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#Velocidade: a medição pública e suas extrapolações

A tabela colaborativa do llama.cpp, que mede Llama 2 7B em Q4_0 (arquivo de 3,56 GiB, ou seja, 3,82 GB), registra, para a RTX 3080 de 10 GB, 139,65 tokens por segundo na geração e 5.014 na leitura do prompt. Com Flash Attention, a geração permanece em 139,95, mas a leitura passa para 5.570 tokens por segundo, ou seja, cerca de 11% a mais. A largura de banda de 760 GB/s permitiria, em teoria, quase 199 tokens por segundo: a medição atinge 70% desse limite. A taxa depende também do driver, do sistema e do fabricante da placa, mesmo com chip idêntico.

Comparação com outras placas (Llama 2 7B Q4_0, geração)
PlacaMemóriaGeração (tok/s)
RTX 3060 12 GB12 GB75,6
RTX 3080 10 GB10 GB139,7
RTX 309024 GB158,2

Por regra de três com o tamanho dos arquivos, a 3080 de 10 GB daria, no máximo, cerca de 89 tokens por segundo em Qwen 3.5 9B em Q4 (6 GB) e cerca de 76 em Gemma 4 12B em Q4 (7 GB). São limites teóricos superiores, não medidas reais. Em uma 3080 de 12 GB, o Q8 do Qwen 3.5 9B (10 GB) permaneceria abaixo de 65 tokens por segundo teoricamente, o que é confortável. Em todos os casos, essas placas ultrapassam largamente a velocidade de leitura; a limitação é a capacidade, não a velocidade.

A leitura do prompt é o segundo ponto forte dessas placas. A 5.014 tokens por segundo, a 3080 de 10 GB lê um documento de 10.000 tokens em cerca de dois segundos e, a 5.570 com Flash Attention, em um pouco menos de tempo — dois cálculos teóricos que pressupõem uma taxa constante. Isso é cerca de duas vezes mais rápido do que uma 3060 de 12 GB (2.138 tokens por segundo). Essa leitura do prompt pesa ainda mais quando várias pessoas compartilham a mesma máquina, pois cada requisição precisa primeiro reler seu próprio contexto antes de gerar qualquer resposta, e é aí que a diferença em relação a uma placa mais modesta aumenta. Para RAG com documentos volumosos ou um assistente de código que relê arquivos grandes a cada requisição, isso representa um ganho real de conforto, bem mais perceptível do que a diferença na geração, cuja velocidade já está muito acima do ritmo de leitura.

#Comprar em 2026: como essas placas se posicionam

Em comparação com uma placa nova de 16 GB, o atrativo de uma RTX 3080 usada é a velocidade a um preço moderado, mas falta memória. A 3090 registra 158,2 tokens por segundo com 24 GB, o que a torna uma referência no mercado de usados para quem busca modelos de 20 a 30 bilhões de parâmetros. Os preços das placas usadas variam a cada semana: o acompanhamento do site registra o menor preço de cada placa e o preço por GB de VRAM, o que é melhor do que um número escrito aqui.

Qual placa escolher de acordo com o modelo desejado
Modelo alvoMemória necessáriaPlaca adequada
8 a 9B em Q46 GB de pesosToda placa com 8 GB
12B em Q4 ou 9B em Q87 a 10 GB de pesos3080 12 GB ou Ti, ou 3080 10 GB para o Q4
20B em Q4 (gpt-oss 20B)13 GB de pesosPlaca de 16 GB ou mais

#Veredito 2026

3080 de 12 GB ou 3080 Ti usada
Uma escolha muito boa se o preço continuar bem abaixo do de uma placa nova de 12 a 16 GB: 12 GB, alta velocidade e um modelo de 9B em Q8 ou de 12B em Q4, com folga.
3080 10 GB
Útil para modelos de 8 a 12 bilhões em Q4. Não comporta modelos de 9B em Q8 nem oferece margem para o contexto; uma 3060 de 12 GB pode ser mais adequada se você busca capacidade em vez de velocidade.
Na hora da compra
Verifique a alimentação, a indicação de 10 ou 12 GB e o estado das ventoinhas: essas placas já estiveram sujeitas a altas temperaturas e têm vários anos de uso.

#Perguntas frequentes

Perguntas frequentes
RTX 3080 de 10 GB ou 12 GB para um LLM?+
Escolha a versão de 12 GB se os preços forem próximos: seus 2 GB extras permitem usar o Qwen 3.5 9B em Q8 (10 GB de pesos) e dão margem para o Gemma 4 12B, enquanto a versão de 10 GB se limita aos modelos de 8–9B em Q4 e a um 12B em Q4 com contexto moderado. Seu barramento mais largo também oferece cerca de 20% mais largura de banda.
RTX 3080 Ti ou RTX 3090 para um LLM?+
A 3090 tem 24 GB contra 12 GB e atinge 158,2 tokens por segundo no teste do llama.cpp, o que permite usar modelos de 20 a 30 bilhões em Q4. A 3080 Ti é suficiente se você ficar em modelos de no máximo 12 bilhões. Para esses modelos, as velocidades de geração continuam próximas: a capacidade é o fator decisivo.
A RTX 3080 de 12 GB consegue rodar gpt-oss 20B?+
Não cabe inteiramente na placa. O catálogo indica 13 GB em Q4 para esse modelo, ou seja, 1 GB a mais do que a memória de uma 3080 de 12 GB: o modelo seria distribuído entre a memória da placa e a RAM, e a velocidade cairia. É necessária uma placa de 16 GB para executá-lo em velocidade máxima.
Quantos tokens por segundo em uma RTX 3080?+
A tabela pública do llama.cpp indica 139,7 tokens por segundo para a 3080 de 10 GB com o Llama 2 7B em Q4_0. Um modelo mais pesado será mais lento: cerca de 89 para um 9B em Q4 e 76 para um 12B em Q4, segundo uma estimativa teórica. A versão de 12 GB e a Ti devem ser um pouco mais rápidas, mas não há medição pública.
Qual fonte de alimentação usar para uma RTX 3080 Ti?+
A NVIDIA anuncia 350 W para a placa e recomenda uma fonte de alimentação de 750 W para o sistema, tanto para a 3080 quanto para a 3080 Ti. Uma fonte de 650 W está abaixo dessa recomendação. Preveja também os conectores adequados e uma boa ventilação do gabinete, pois essas placas dissipam muito calor sob carga.
O Ollama funciona em uma RTX 3080?+
Sim. O Ollama lista as RTX 3080 e 3080 Ti entre as placas com capacidade de computação 8.6 e exige um driver 550 ou mais recente. Na versão de 10 GB, ative o Flash Attention e a quantização do cache K/V para economizar memória em contextos longos.
A RTX 3080 ainda vale a pena em 2026?+
Sim, se o preço de segunda mão permanecer significativamente abaixo do de uma placa nova equivalente em memória. Sua velocidade é excelente, mas sua capacidade de 10 ou 12 GB é o que importa: consulte o rastreamento de preços do site e compare com placas de 16 GB antes de decidir.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.