Qual LLM para RTX 3080 / 3080 Ti (10-12 GB) ?
Para um LLM local, uma RTX 3080 ou 3080 Ti de 12 GB executa Qwen 3.5 9B em Q8 (10 GB) e Gemma 4 12B em Q4 (7 GB) com margem, a cerca de 140 tokens/s em um modelo de 7B: a RTX 3080 de 10 GB atinge 139,7 no teste de llama.cpp. A versão de 10 GB limita-se a modelos de 8-9B em Q4. Nenhuma das três carrega um modelo de 20B em Q4 (13 GB) sem transferir parte dele para a RAM.
Três placas levam o nome RTX 3080: a de 10 GB de setembro de 2020, a de 12 GB de janeiro de 2022 e a 3080 Ti de 12 GB de junho de 2021. Elas têm o mesmo chip, mas não a mesma memória, e é a memória que determina o que você consegue rodar. Este guia se baseia em uma medição pública para a velocidade e nas fichas técnicas oficiais para a capacidade.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Opção de compra para este guia: RTX 5080 16 GB.
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Compare todas as opções por orçamento, de 800 a 3 500 € →
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#RTX 3080 e 3080 Ti para um LLM local: as três variantes
Uma RTX 3080 ou uma 3080 Ti com 12 GB roda com conforto um modelo de 12 bilhões de parâmetros em Q4 ou um modelo de 9 bilhões em Q8; a versão com 10 GB limita-se a modelos de 7 a 9 bilhões em Q4. De acordo com o catálogo QuelLLM, Gemma 4 12B pesa 7 GB em Q4 e 9 GB em Q5; Qwen 3.5 9B pesa 6 GB em Q4 e 10 GB em Q8, o que exige pelo menos 12 GB assim que se adiciona contexto. Em termos de velocidade, essas placas estão entre as mais rápidas das gerações anteriores: a 3080 de 10 GB gera 139,7 tokens por segundo em um modelo de 7 bilhões em Q4_0 segundo a tabela pública do llama.cpp, o que equivale a quase o dobro da RTX 3060 de 12 GB (75,6). A escolha de uma RTX 3080 para um LLM depende da memória, nunca da velocidade.
- RTX 3080 10 GB
- Setembro de 2020, 8.704 núcleos CUDA, 10 GB de GDDR6X em um barramento de 320 bits, ou seja, 760 GB/s. Potência da placa de 320 W.
- RTX 3080 12 GB
- Janeiro de 2022, 8.960 núcleos, 12 GB de GDDR6X em um barramento de 384 bits, ou seja, 912 GB/s, 350 W. Cerca de 20 % a mais de largura de banda.
- RTX 3080 Ti
- Junho de 2021, 10.240 núcleos, 12 GB de GDDR6X em um barramento de 384 bits, como na 3080 de 12 GB, portanto uma largura de banda esperada idêntica, 350 W.
O cálculo do limite ajuda a entender: a geração de texto lê os pesos em cada token, então a banda larga define a velocidade máxima. As 3080 12 GB e Ti ganham 20% de banda larga em relação às 10 GB, mas a 3080 Ti adiciona principalmente núcleos de cálculo, que aceleram a leitura do prompt mais do que a geração.
#3080 10 GB, 12 GB ou 3080 Ti: qual escolher
| Critério | 3080 10 GB | 3080 12 GB | 3080 Ti 12 GB |
|---|---|---|---|
| Núcleos CUDA | 8 704 | 8 960 | 10 240 |
| Memória | 10 GB GDDR6X | 12 GB GDDR6X | 12 GB GDDR6X |
| Barramento / largura de banda | 320 bits / 760 GB/s | 384 bits / 912 GB/s | 384 bits, mesma largura de banda esperada |
| Potência da placa | 320 W | 350 W | 350 W |
| Geração com Llama 2 7B Q4_0 | 139,7 tok/s (medida) | estimativa: até aproximadamente 167 | estimativa: próximo ao desempenho da versão de 12 GB |
Para IA local, a 3080 Ti e a 3080 de 12 GB são intercambiáveis: os mesmos 12 GB, o mesmo barramento e uma velocidade de geração muito próxima. A estimativa para essas duas placas é um limite superior que aplica à largura de banda de 912 GB/s o rendimento medido da versão de 10 GB: na prática, a 3090, cujo barramento também é de 384 bits, registra 158,2 tokens por segundo. Portanto, escolha a mais barata das duas, sem se deixar guiar pelo número de núcleos. A versão de 10 GB, por sua vez, fica um nível abaixo em capacidade: seus 10 GB não permitem usar modelos de 9 bilhões de parâmetros em Q8.
#Modelos compatíveis de acordo com a memória
| Modelo e quantização | Tamanho do modelo | 3080 10 GB | 3080 12 GB / Ti |
|---|---|---|---|
| Qwen 3.5 9B em Q4 | 6 GB | Sim, com contexto | Sim, com muito contexto |
| Gemma 4 12B em Q4 | 7 GB | Sim, contexto moderado | Sim, confortável |
| Gemma 4 12B em Q5 | 9 GB | Muito apertado | Sim, contexto moderado |
| Qwen 3.5 9B em Q8 | 10 GB | Não | Sim, mas com pouco contexto |
| gpt-oss 20B em Q4 | 13 GB | Não | Não: excede a capacidade em 1 GB |
Dois pontos dessa tabela merecem atenção. Primeiro, a 3080 de 10 GB consegue rodar o Gemma 4 12B em Q4 (7 GB), apesar do que se poderia imaginar: restam 3 GB para o contexto, o que é suficiente para conversas de tamanho médio. Em seguida, a diferença entre 12 e 16 GB é clara: um modelo da classe de 20 bilhões de parâmetros em Q4, como gpt-oss 20B, pesa 13 GB e não cabe em nenhuma das três placas. Se esse é o seu objetivo, você precisa de uma placa com 16 GB ou mais, e o guia sobre 12 GB de VRAM detalha exatamente o que se pode fazer com 12 GB.
#Instalação, alimentação e configurações
As RTX 3080 e 3080 Ti estão entre as placas com capacidade de cálculo 8.6 listadas pelo Ollama, que exige um driver 550 ou mais recente. Um ponto de atenção específico dessas placas: a ficha técnica da NVIDIA informa 350 W para a placa, 320 W para a versão de 10 GB e recomenda uma fonte de alimentação de 750 W para o sistema. Verifique sua fonte de alimentação antes de instalar a placa e ligue os conectores da placa a cabos distintos.
- 01Verificar a fonte de alimentaçãoVerifique se a fonte de alimentação chega a 750 W e se possui os conectores exigidos pelo modelo da sua placa.
- 02Instalar o driver e OllamaInstale um driver 550 ou mais recente, depois o Ollama, e inicie um modelo de sua escolha.
- 03Ajustar a memóriaNa versão de 10 GB, inicie o servidor com OLLAMA_FLASH_ATTENTION=1 e OLLAMA_KV_CACHE_TYPE=q8_0: a documentação especifica que o cache K/V pode ser quantizado quando o Flash Attention está ativado.
- 04VerificarCom o nvidia-smi, monitore a memória e a temperatura sob carga: essas placas aquecem mais do que os modelos recentes.
#Velocidade: a medição pública e suas extrapolações
A tabela colaborativa do llama.cpp, que mede Llama 2 7B em Q4_0 (arquivo de 3,56 GiB, ou seja, 3,82 GB), registra, para a RTX 3080 de 10 GB, 139,65 tokens por segundo na geração e 5.014 na leitura do prompt. Com Flash Attention, a geração permanece em 139,95, mas a leitura passa para 5.570 tokens por segundo, ou seja, cerca de 11% a mais. A largura de banda de 760 GB/s permitiria, em teoria, quase 199 tokens por segundo: a medição atinge 70% desse limite. A taxa depende também do driver, do sistema e do fabricante da placa, mesmo com chip idêntico.
| Placa | Memória | Geração (tok/s) |
|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 |
| RTX 3080 10 GB | 10 GB | 139,7 |
| RTX 3090 | 24 GB | 158,2 |
Por regra de três com o tamanho dos arquivos, a 3080 de 10 GB daria, no máximo, cerca de 89 tokens por segundo em Qwen 3.5 9B em Q4 (6 GB) e cerca de 76 em Gemma 4 12B em Q4 (7 GB). São limites teóricos superiores, não medidas reais. Em uma 3080 de 12 GB, o Q8 do Qwen 3.5 9B (10 GB) permaneceria abaixo de 65 tokens por segundo teoricamente, o que é confortável. Em todos os casos, essas placas ultrapassam largamente a velocidade de leitura; a limitação é a capacidade, não a velocidade.
A leitura do prompt é o segundo ponto forte dessas placas. A 5.014 tokens por segundo, a 3080 de 10 GB lê um documento de 10.000 tokens em cerca de dois segundos e, a 5.570 com Flash Attention, em um pouco menos de tempo — dois cálculos teóricos que pressupõem uma taxa constante. Isso é cerca de duas vezes mais rápido do que uma 3060 de 12 GB (2.138 tokens por segundo). Essa leitura do prompt pesa ainda mais quando várias pessoas compartilham a mesma máquina, pois cada requisição precisa primeiro reler seu próprio contexto antes de gerar qualquer resposta, e é aí que a diferença em relação a uma placa mais modesta aumenta. Para RAG com documentos volumosos ou um assistente de código que relê arquivos grandes a cada requisição, isso representa um ganho real de conforto, bem mais perceptível do que a diferença na geração, cuja velocidade já está muito acima do ritmo de leitura.
#Comprar em 2026: como essas placas se posicionam
Em comparação com uma placa nova de 16 GB, o atrativo de uma RTX 3080 usada é a velocidade a um preço moderado, mas falta memória. A 3090 registra 158,2 tokens por segundo com 24 GB, o que a torna uma referência no mercado de usados para quem busca modelos de 20 a 30 bilhões de parâmetros. Os preços das placas usadas variam a cada semana: o acompanhamento do site registra o menor preço de cada placa e o preço por GB de VRAM, o que é melhor do que um número escrito aqui.
| Modelo alvo | Memória necessária | Placa adequada |
|---|---|---|
| 8 a 9B em Q4 | 6 GB de pesos | Toda placa com 8 GB |
| 12B em Q4 ou 9B em Q8 | 7 a 10 GB de pesos | 3080 12 GB ou Ti, ou 3080 10 GB para o Q4 |
| 20B em Q4 (gpt-oss 20B) | 13 GB de pesos | Placa de 16 GB ou mais |
- Preços de placas de vídeo para IA local (acompanhamento semanal)
- Qual LLM na RTX 3090 / 3090 Ti (24 GB)?
- Qual LLM para RTX 4070 Ti Super (16 GB)?
#Veredito 2026
- 3080 de 12 GB ou 3080 Ti usada
- Uma escolha muito boa se o preço continuar bem abaixo do de uma placa nova de 12 a 16 GB: 12 GB, alta velocidade e um modelo de 9B em Q8 ou de 12B em Q4, com folga.
- 3080 10 GB
- Útil para modelos de 8 a 12 bilhões em Q4. Não comporta modelos de 9B em Q8 nem oferece margem para o contexto; uma 3060 de 12 GB pode ser mais adequada se você busca capacidade em vez de velocidade.
- Na hora da compra
- Verifique a alimentação, a indicação de 10 ou 12 GB e o estado das ventoinhas: essas placas já estiveram sujeitas a altas temperaturas e têm vários anos de uso.
#Perguntas frequentes
RTX 3080 de 10 GB ou 12 GB para um LLM?+
RTX 3080 Ti ou RTX 3090 para um LLM?+
A RTX 3080 de 12 GB consegue rodar gpt-oss 20B?+
Quantos tokens por segundo em uma RTX 3080?+
Qual fonte de alimentação usar para uma RTX 3080 Ti?+
O Ollama funciona em uma RTX 3080?+
A RTX 3080 ainda vale a pena em 2026?+
- Fonte: tabela de desempenho do llama.cpp em CUDA
- Fonte: ficha técnica da NVIDIA das RTX 3080 e 3080 Ti
- Fonte: placas NVIDIA suportadas pelo Ollama
- Fonte: FAQ do Ollama (Flash Attention, cache K/V)
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.