Iniciante 10 minConceitos

CUDA: o que é e é preciso instalá-lo para IA ?

Resposta direta

CUDA é a plataforma de software proprietária que a NVIDIA lançou em 2007 para usar suas GPUs em computação de propósito geral, não apenas em gráficos. Ela funciona apenas em hardware NVIDIA e serve de base para quase todos os softwares de IA. Para inferência com Ollama ou LM Studio, basta ter um driver NVIDIA atualizado: as bibliotecas CUDA já estão integradas. O Toolkit completo serve apenas para compilar código a partir do código-fonte.

CUDA é a plataforma de software da NVIDIA que permite usar uma placa de vídeo para computação de propósito geral, e não mais apenas para exibir imagens. Lançada em 2007, ela funciona apenas em hardware NVIDIA. Quase todos os softwares de IA são desenvolvidos primeiro para essa plataforma, o que explica por que as placas GeForce são o caminho mais simples para a IA local. Em 20 de setembro de 2026, uma confusão ainda é muito comum: para rodar Ollama ou LM Studio, você não precisa “instalar CUDA”. Esta página explica o que é CUDA, o que realmente precisa ser instalado e como interpretar os números de versão.

Por Mohamed Meguedmi·Atualização 2026-09-28·Testado no Windows, macOS e Linux

#O que é CUDA?

Uma placa de vídeo contém milhares de pequenos processadores projetados para aplicar a mesma operação a um grande número de dados ao mesmo tempo, em vez de realizar uma operação complexa por vez, como uma CPU. No início, esses processadores só podiam ser utilizados por meio de interfaces gráficas: era necessário disfarçar um cálculo como uma imagem para passá-lo pelo pipeline 3D. CUDA, sigla de Compute Unified Device Architecture, eliminou esse disfarce já em seu lançamento, em 2007. Um programador escreve código comum, em C, em C++ ou chamado a partir do Python, e esse código é executado diretamente nesses processadores, sem passar pela renderização gráfica.

No uso comum, “CUDA” designa quatro coisas ao mesmo tempo: o modelo de programação, o compilador nvcc, a parte do driver que executa o código e um conjunto de bibliotecas otimizadas como cuBLAS para álgebra linear e cuDNN para redes neurais. Os frameworks como PyTorch dependem dessas bibliotecas, e as aplicações de IA, por sua vez, dependem dos frameworks: é uma pilha de camadas sucessivas, em que cada camada oculta a complexidade da camada abaixo. Quando uma ferramenta anuncia “compatível com CUDA”, isso significa concretamente que seus cálculos pesados, principalmente multiplicações de matrizes e convoluções, acabam sendo executados nessas bibliotecas proprietárias da NVIDIA em vez de em código genérico.

#E os “núcleos CUDA”?

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

É o nome de marketing que a NVIDIA dá aos processadores paralelos de uma GPU, suas unidades básicas de cálculo. Uma RTX 4060 tem 3.072, uma RTX 5090 tem 21.760, quase sete vezes mais, segundo as fichas técnicas do fabricante. Mais núcleos significam mais cálculos por segundo, o que conta diretamente para a geração de imagens, o treinamento de um modelo e a leitura do prompt por um LLM, a fase em que a GPU precisa processar de uma só vez todo o texto já escrito.

Isso conta muito menos para o que mais percebemos ao usar um LLM no dia a dia: a velocidade de escrita, token após token. Nesse caso, o limite é a velocidade com que os pesos são lidos na memória, e não a velocidade com que são multiplicados depois de lidos. Uma placa com menos núcleos, mas com uma VRAM maior e mais rápida, escreverá, portanto, muitas vezes mais rápido na prática do que uma placa mais potente no papel, mas com largura de banda de memória mais limitada.

#Driver, bibliotecas, Toolkit: o que precisa ser instalado?

ComponenteO que éQuem precisa disso
Driver NVIDIAFaz o sistema e a placa se comunicarem; contém a parte de execução do CUDATodo proprietário de uma placa NVIDIA
Bibliotecas de execuçãocuBLAS, cuDNN e similaresJá incluídas na maioria dos aplicativos e nos pacotes PyTorch: você quase nunca as instala por conta própria
CUDA ToolkitO compilador nvcc, os headers e as ferramentas de criação de perfilApenas aqueles que compilam código CUDA, por exemplo, llama.cpp a partir do código-fonte
→
Em termos claros
Para Ollama, LM Studio, ComfyUI Desktop ou um simples pip install torch: atualize o driver, e pronto. Instalar o Toolkit de vários gigabytes “por precaução” é a etapa inútil mais frequente dos tutoriais de IA local.

#Ler os números de versão

Dois comandos, duas informações diferentes
nvidia-smi        # version du pilote, et version MAXIMALE de CUDA qu'il sait exécuter
nvcc --version    # version du Toolkit, s'il est installé

Esses dois números diferem legitimamente, e o primeiro engana quase todo mundo. Quando o nvidia-smi exibe « CUDA Version: 13.0 », isso significa que o seu driver pode executar softwares compilados para CUDA até a versão 13.0. Isso não significa que o Toolkit esteja instalado. E um software compilado para uma versão mais antiga do CUDA funciona sem problemas com um driver recente.

i
CUDA 13 mudou um hábito
Para CUDA 13.x, a NVIDIA exige um driver na versão 580 ou superior, de acordo com suas notas oficiais de versão. E desde essa mesma versão 13.0, o driver de vídeo do Windows não é mais fornecido com o pacote do Toolkit: agora é necessário instalá-lo separadamente a partir do site da NVIDIA. Uma causa frequente de falhas de compilação para quem reutiliza um pacote antigo do Toolkit baixado antes dessa mudança.

#A capacidade de processamento, geração após geração

Cada GPU NVIDIA possui um número de « capacidade de computação » (compute capability) que identifica sua arquitetura e as instruções que ela suporta nativamente. Os softwares são compilados para capacidades específicas, geralmente uma faixa de versões coberta por um mesmo pacote, e os projetos abandonam regularmente o suporte às mais antigas ao longo das atualizações. É isso, muito mais do que a velocidade de cálculo bruta, que encerra a carreira de uma placa em IA local: uma RTX 2060 continua fisicamente funcional anos após a compra, mas algumas ferramentas recentes se recusam a ser instaladas nela por falta de código compilado para sua geração.

Placas da base de dados de hardware do QuelLLM · 20/09/2026
GeraçãoPlacasCapacidade de processamentoSituação para a IA local em 2026
PascalGTX 1060, 1070, 1080 Ti6.1Executa ferramentas baseadas em llama.cpp; sem aceleração FP16; deixou de ser suportada por alguns frameworks recentes
TuringGTX 1660, RTX 2060 a 2080 Ti7.5Mínimo exigido pelo vLLM (7.0); bom suporte
AmpereRTX 3050 a 3090 Ti8.6Suporte completo; inclui BF16
Ada LovelaceRTX 4060 em uma 40908.9Plenamente compatível; adiciona o FP8
BlackwellRTX 5050 a 509012.0Totalmente suportada pelos softwares recentes; as versões antigas devem ser atualizadas ou recompiladas; traz o FP4

A última linha explica a onda de mensagens « minha RTX 50 não é detectada »: um binário compilado antes da existência dessa arquitetura não contém código para a capacidade 12.0. A solução é uma versão mais recente da ferramenta ou um PyTorch compilado para uma versão recente do CUDA.

!
A armadilha «Blackwell»: duas famílias incompatíveis sob o mesmo nome
A NVIDIA vende dois chips diferentes sob o nome Blackwell, e confundi-los compromete uma instalação. As GeForce RTX 50 voltadas ao consumidor usam a capacidade computacional 12.x (sm_120). As placas de datacenter B100 e B200 usam a capacidade 10.x (sm_100). São duas famílias distintas: um binário compilado para sm_100 não pode ser executado em uma RTX 5090, e vice-versa. Se um tutorial de fine-tuning mencionar “Blackwell” sem especificar sm_120 ou sm_100, verifique antes de instalar um pacote pré-compilado: essa é uma fonte frequente de erros “no kernel image is available” nas placas mais recentes voltadas ao consumidor.

#CUDA em comparação com ROCm, Metal e Vulkan

PlataformaFabricanteHardwareEstado para LLMs locais
CUDANVIDIAGPU NVIDIAPlataforma de referência: tudo oferece suporte a ela primeiro
ROCmAMDRadeon mais recentes e InstinctBom no Linux com as placas compatíveis; lista de placas mais restrita
MetalAppleApple SiliconExcelente via llama.cpp e MLX
VulkanKhronos, padrão abertoQuase todas as GPUs, inclusive as integradasFunciona em quase todos os lugares com llama.cpp; em geral, é mais lento que a solução nativa
SYCL / oneAPIIntelIntel Arc e GPUs integradasFuncional, ecossistema mais limitado

A vantagem do CUDA não se deve ao fato de que os outros seriam incapazes de fazer os cálculos. Ela se deve a quase vinte anos de bibliotecas, ferramentas e código comprovado, desenvolvidos GPU após GPU desde 2007, segundo a página oficial do projeto. Para inferência com as ferramentas usuais, a diferença diminuiu bastante: o llama.cpp roda nas cinco plataformas, com desempenho semelhante quando a quantização é a mesma e o hardware é comparável. Para treinamento, fine-tuning e código de pesquisa recém-publicado no GitHub, porém, o CUDA continua sendo o único caminho que funciona desde o primeiro dia: é quase sempre o primeiro alvo, às vezes o único, dos repositórios que acompanham um novo artigo científico, muitas vezes vários meses antes de surgir uma adaptação para as outras plataformas, se é que ela chega a surgir.

#O que isso muda na hora de comprar

Você quer que tudo funcione sem precisar solucionar problemas
Escolha uma placa NVIDIA e priorize a capacidade de VRAM em vez do número de núcleos CUDA exibido na caixa: é ela que determina se um modelo será carregado, não o poder bruto de processamento.
Você executa principalmente GGUF no Ollama ou no LM Studio
Um Mac com Apple Silicon ou uma Radeon recente no Linux com ROCm é uma opção válida: o llama.cpp oferece suporte adequado a essas duas plataformas, e você perde pouco em comodidade de uso no dia a dia.
Você pretende fazer fine-tuning, usar vLLM ou acompanhar repositórios de pesquisa
A ausência de CUDA vai custar tempo todas as semanas, entre dependências que não conseguem ser compiladas e notebooks publicados supondo que uma GPU NVIDIA esteja disponível por padrão.
Você compra uma placa usada
Evite qualquer placa com capacidade de computação inferior a 7.5, independentemente do preço anunciado: além da lentidão, alguns frameworks recentes simplesmente não permitem a instalação.

#FAQ

O que significa CUDA?+
Compute Unified Device Architecture. A NVIDIA a lançou em 2007 para que suas GPUs pudessem ser programadas com código de uso geral, em linguagens como C, C++ ou Python, e não mais apenas controladas por meio de uma interface gráfica. Foi essa mudança que tornou possível, uma década depois, a expansão do deep learning em placas de vídeo, pois antes era necessário disfarçar cada cálculo como uma operação de exibição para executá-lo em uma GPU.
É preciso instalar o CUDA para executar uma IA localmente?+
Geralmente não. Ollama, LM Studio e aplicações semelhantes já incluem as bibliotecas CUDA de que precisam para a inferência: basta ter um driver NVIDIA atualizado, sem precisar baixar mais nada. O CUDA Toolkit completo, que ocupa vários gigabytes, só é necessário para compilar um software a partir de seu código-fonte, por exemplo, llama.cpp com a aceleração por GPU ativada manualmente.
O CUDA funciona em uma placa AMD ou Intel?+
Não, nunca: CUDA é uma tecnologia proprietária que funciona apenas em hardware NVIDIA, por decisão comercial do fabricante. O equivalente na AMD chama-se ROCm, na Apple é Metal, na Intel é oneAPI, e Vulkan continua sendo a opção para hardware de vários fabricantes, com suporte na maioria das ferramentas baseadas em llama.cpp, inclusive em hardware mais antigo ou em GPUs integradas.
Por que nvidia-smi e nvcc não exibem a mesma versão?+
nvidia-smi indica a versão máxima do CUDA que o driver instalado consegue executar, não o que está realmente instalado na máquina. Já o nvcc indica a versão do CUDA Toolkit efetivamente presente, se houver uma. Os dois números são independentes, e um software compilado para uma versão mais antiga do CUDA continua funcionando sem problemas com um driver mais recente.
Ter mais núcleos CUDA é melhor para um LLM?+
Isso acelera principalmente a leitura do prompt e a geração de imagens, duas tarefas que exigem muito poder de cálculo. A velocidade de geração de texto de um LLM, o aspecto mais perceptível durante o uso, depende mais da capacidade e da largura de banda da memória da placa: para modelos de linguagem executados localmente, a VRAM costuma, portanto, contar mais do que o número bruto de núcleos CUDA anunciado.
As RTX 50 e as placas Blackwell de datacenter têm a mesma capacidade de computação?+
Não, e essa confusão frequentemente compromete uma instalação. As GeForce RTX 50 voltadas ao consumidor usam a capacidade de computação 12.x (sm_120); as placas de datacenter B100 e B200 usam a 10.x (sm_100). Um binário ou um pacote pré-compilado para uma delas não pode ser executado na outra: um tutorial de fine-tuning que menciona apenas “Blackwell” sem especificar qual delas deve ser verificado antes de instalar qualquer coisa.

Hardware recomendado: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — placa NVIDIA recente com 16 GB de VRAM, compatível com CUDA. Todo o hardware de IA →

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.