CUDA: o que é e é preciso instalá-lo para IA ?
CUDA é a plataforma de software proprietária que a NVIDIA lançou em 2007 para usar suas GPUs em computação de propósito geral, não apenas em gráficos. Ela funciona apenas em hardware NVIDIA e serve de base para quase todos os softwares de IA. Para inferência com Ollama ou LM Studio, basta ter um driver NVIDIA atualizado: as bibliotecas CUDA já estão integradas. O Toolkit completo serve apenas para compilar código a partir do código-fonte.
CUDA é a plataforma de software da NVIDIA que permite usar uma placa de vídeo para computação de propósito geral, e não mais apenas para exibir imagens. Lançada em 2007, ela funciona apenas em hardware NVIDIA. Quase todos os softwares de IA são desenvolvidos primeiro para essa plataforma, o que explica por que as placas GeForce são o caminho mais simples para a IA local. Em 20 de setembro de 2026, uma confusão ainda é muito comum: para rodar Ollama ou LM Studio, você não precisa “instalar CUDA”. Esta página explica o que é CUDA, o que realmente precisa ser instalado e como interpretar os números de versão.
#O que é CUDA?
Uma placa de vídeo contém milhares de pequenos processadores projetados para aplicar a mesma operação a um grande número de dados ao mesmo tempo, em vez de realizar uma operação complexa por vez, como uma CPU. No início, esses processadores só podiam ser utilizados por meio de interfaces gráficas: era necessário disfarçar um cálculo como uma imagem para passá-lo pelo pipeline 3D. CUDA, sigla de Compute Unified Device Architecture, eliminou esse disfarce já em seu lançamento, em 2007. Um programador escreve código comum, em C, em C++ ou chamado a partir do Python, e esse código é executado diretamente nesses processadores, sem passar pela renderização gráfica.
No uso comum, “CUDA” designa quatro coisas ao mesmo tempo: o modelo de programação, o compilador nvcc, a parte do driver que executa o código e um conjunto de bibliotecas otimizadas como cuBLAS para álgebra linear e cuDNN para redes neurais. Os frameworks como PyTorch dependem dessas bibliotecas, e as aplicações de IA, por sua vez, dependem dos frameworks: é uma pilha de camadas sucessivas, em que cada camada oculta a complexidade da camada abaixo. Quando uma ferramenta anuncia “compatível com CUDA”, isso significa concretamente que seus cálculos pesados, principalmente multiplicações de matrizes e convoluções, acabam sendo executados nessas bibliotecas proprietárias da NVIDIA em vez de em código genérico.
#E os “núcleos CUDA”?
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
É o nome de marketing que a NVIDIA dá aos processadores paralelos de uma GPU, suas unidades básicas de cálculo. Uma RTX 4060 tem 3.072, uma RTX 5090 tem 21.760, quase sete vezes mais, segundo as fichas técnicas do fabricante. Mais núcleos significam mais cálculos por segundo, o que conta diretamente para a geração de imagens, o treinamento de um modelo e a leitura do prompt por um LLM, a fase em que a GPU precisa processar de uma só vez todo o texto já escrito.
Isso conta muito menos para o que mais percebemos ao usar um LLM no dia a dia: a velocidade de escrita, token após token. Nesse caso, o limite é a velocidade com que os pesos são lidos na memória, e não a velocidade com que são multiplicados depois de lidos. Uma placa com menos núcleos, mas com uma VRAM maior e mais rápida, escreverá, portanto, muitas vezes mais rápido na prática do que uma placa mais potente no papel, mas com largura de banda de memória mais limitada.
#Driver, bibliotecas, Toolkit: o que precisa ser instalado?
| Componente | O que é | Quem precisa disso |
|---|---|---|
| Driver NVIDIA | Faz o sistema e a placa se comunicarem; contém a parte de execução do CUDA | Todo proprietário de uma placa NVIDIA |
| Bibliotecas de execução | cuBLAS, cuDNN e similares | Já incluídas na maioria dos aplicativos e nos pacotes PyTorch: você quase nunca as instala por conta própria |
| CUDA Toolkit | O compilador nvcc, os headers e as ferramentas de criação de perfil | Apenas aqueles que compilam código CUDA, por exemplo, llama.cpp a partir do código-fonte |
#Ler os números de versão
Esses dois números diferem legitimamente, e o primeiro engana quase todo mundo. Quando o nvidia-smi exibe « CUDA Version: 13.0 », isso significa que o seu driver pode executar softwares compilados para CUDA até a versão 13.0. Isso não significa que o Toolkit esteja instalado. E um software compilado para uma versão mais antiga do CUDA funciona sem problemas com um driver recente.
#A capacidade de processamento, geração após geração
Cada GPU NVIDIA possui um número de « capacidade de computação » (compute capability) que identifica sua arquitetura e as instruções que ela suporta nativamente. Os softwares são compilados para capacidades específicas, geralmente uma faixa de versões coberta por um mesmo pacote, e os projetos abandonam regularmente o suporte às mais antigas ao longo das atualizações. É isso, muito mais do que a velocidade de cálculo bruta, que encerra a carreira de uma placa em IA local: uma RTX 2060 continua fisicamente funcional anos após a compra, mas algumas ferramentas recentes se recusam a ser instaladas nela por falta de código compilado para sua geração.
| Geração | Placas | Capacidade de processamento | Situação para a IA local em 2026 |
|---|---|---|---|
| Pascal | GTX 1060, 1070, 1080 Ti | 6.1 | Executa ferramentas baseadas em llama.cpp; sem aceleração FP16; deixou de ser suportada por alguns frameworks recentes |
| Turing | GTX 1660, RTX 2060 a 2080 Ti | 7.5 | Mínimo exigido pelo vLLM (7.0); bom suporte |
| Ampere | RTX 3050 a 3090 Ti | 8.6 | Suporte completo; inclui BF16 |
| Ada Lovelace | RTX 4060 em uma 4090 | 8.9 | Plenamente compatível; adiciona o FP8 |
| Blackwell | RTX 5050 a 5090 | 12.0 | Totalmente suportada pelos softwares recentes; as versões antigas devem ser atualizadas ou recompiladas; traz o FP4 |
A última linha explica a onda de mensagens « minha RTX 50 não é detectada »: um binário compilado antes da existência dessa arquitetura não contém código para a capacidade 12.0. A solução é uma versão mais recente da ferramenta ou um PyTorch compilado para uma versão recente do CUDA.
#CUDA em comparação com ROCm, Metal e Vulkan
| Plataforma | Fabricante | Hardware | Estado para LLMs locais |
|---|---|---|---|
| CUDA | NVIDIA | GPU NVIDIA | Plataforma de referência: tudo oferece suporte a ela primeiro |
| ROCm | AMD | Radeon mais recentes e Instinct | Bom no Linux com as placas compatíveis; lista de placas mais restrita |
| Metal | Apple | Apple Silicon | Excelente via llama.cpp e MLX |
| Vulkan | Khronos, padrão aberto | Quase todas as GPUs, inclusive as integradas | Funciona em quase todos os lugares com llama.cpp; em geral, é mais lento que a solução nativa |
| SYCL / oneAPI | Intel | Intel Arc e GPUs integradas | Funcional, ecossistema mais limitado |
A vantagem do CUDA não se deve ao fato de que os outros seriam incapazes de fazer os cálculos. Ela se deve a quase vinte anos de bibliotecas, ferramentas e código comprovado, desenvolvidos GPU após GPU desde 2007, segundo a página oficial do projeto. Para inferência com as ferramentas usuais, a diferença diminuiu bastante: o llama.cpp roda nas cinco plataformas, com desempenho semelhante quando a quantização é a mesma e o hardware é comparável. Para treinamento, fine-tuning e código de pesquisa recém-publicado no GitHub, porém, o CUDA continua sendo o único caminho que funciona desde o primeiro dia: é quase sempre o primeiro alvo, às vezes o único, dos repositórios que acompanham um novo artigo científico, muitas vezes vários meses antes de surgir uma adaptação para as outras plataformas, se é que ela chega a surgir.
- Ollama em GPU AMD com ROCm
- llama.cpp com Vulkan, o backend universal
- No Mac: MLX ou llama.cpp?
- Fonte: Wikipedia, histórico e arquitetura do CUDA
- Fonte: tabela das capacidades de computação CUDA por GPU (GPUSmith)
#O que isso muda na hora de comprar
- Você quer que tudo funcione sem precisar solucionar problemas
- Escolha uma placa NVIDIA e priorize a capacidade de VRAM em vez do número de núcleos CUDA exibido na caixa: é ela que determina se um modelo será carregado, não o poder bruto de processamento.
- Você executa principalmente GGUF no Ollama ou no LM Studio
- Um Mac com Apple Silicon ou uma Radeon recente no Linux com ROCm é uma opção válida: o llama.cpp oferece suporte adequado a essas duas plataformas, e você perde pouco em comodidade de uso no dia a dia.
- Você pretende fazer fine-tuning, usar vLLM ou acompanhar repositórios de pesquisa
- A ausência de CUDA vai custar tempo todas as semanas, entre dependências que não conseguem ser compiladas e notebooks publicados supondo que uma GPU NVIDIA esteja disponível por padrão.
- Você compra uma placa usada
- Evite qualquer placa com capacidade de computação inferior a 7.5, independentemente do preço anunciado: além da lentidão, alguns frameworks recentes simplesmente não permitem a instalação.
#FAQ
O que significa CUDA?+
É preciso instalar o CUDA para executar uma IA localmente?+
O CUDA funciona em uma placa AMD ou Intel?+
Por que nvidia-smi e nvcc não exibem a mesma versão?+
Ter mais núcleos CUDA é melhor para um LLM?+
As RTX 50 e as placas Blackwell de datacenter têm a mesma capacidade de computação?+
Hardware recomendado: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — placa NVIDIA recente com 16 GB de VRAM, compatível com CUDA. Todo o hardware de IA →
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.