Iniciante 12 minInstalação

Instalar um LLM localmente: guia passo a passo (2026)

Resposta direta

Instalar um LLM localmente exige três coisas: uma máquina com RAM ou VRAM suficiente para o tamanho do modelo desejado, uma ferramenta para executá-lo — LM Studio sem terminal, Ollama pela linha de comando ou llama.cpp para especialistas — e um primeiro modelo quantizado adequado a esse hardware. Reserve de 10 a 15 minutos para ter um primeiro chat local funcional em uma máquina recente; depois de baixar o modelo, não será mais necessária uma conexão com a internet.

Você quer rodar uma IA diretamente no seu PC ou no seu Mac, mas todos os nomes de ferramentas e modelos se parecem e você não sabe por onde começar? Este guia é a visão geral que falta antes de escolher: verificar se sua máquina dá conta, comparar as três formas de instalação, identificar seu primeiro modelo e evitar erros que prejudiquem a primeira tentativa. Cada etapa aponta para um guia específico mais detalhado, se você quiser se aprofundar em um ponto específico.

Por Mohamed Meguedmi·Atualização 2026-08-24·Testado no Windows, macOS e Linux

#Verificar sua máquina: RAM, VRAM e tamanho do modelo

Antes de escolher uma ferramenta, a pergunta realmente importante é: quanta memória sua máquina pode dedicar a um modelo? Um modelo «7B» ou «32B» indica o número de parâmetros, mas é sua versão quantizada — comprimida para caber na memória, com uma pequena perda de precisão — que determina o espaço realmente necessário. A quantização Q4 (frequentemente indicada como Q4_K_M) é o meio-termo padrão para começar: reduz bastante a memória necessária em comparação com os pesos nativos do modelo, com uma perda de qualidade geralmente pouco perceptível no uso.

8 GB de RAM, sem GPU dedicada
modelos leves em torno de 3-4B em Q4: uso básico, respostas mais lentas mas funcionais.
16 GB de RAM (CPU) ou 8 GB de VRAM (GPU)
O ponto de entrada mais confortável, com modelos de 7 a 8B em Q4 — o formato mais comum para um primeiro uso real.
12 GB de VRAM
margem para chegar a um modelo de 14B sem problemas específicos.
24 GB de VRAM (ou 32-48 GB de memória unificada no Mac)
um modelo 32B com quantização Q4 roda confortavelmente.
64 GB ou mais de RAM ou de memória unificada
os modelos em torno de 70B tornam-se viáveis, com offload parcial entre CPU e GPU e uma taxa de geração consideravelmente mais baixa.
i
São apenas referências, não garantias
O tamanho do contexto utilizado, o sistema operacional e os outros aplicativos abertos fazem variar a margem realmente disponível. Mantenha sempre uma margem de cerca de 20 a 30% além da memória ocupada pelo modelo em si antes de considerar uma configuração confortável.

#Escolher o método: LM Studio, Ollama ou llama.cpp

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Três grandes caminhos permitem executar um LLM localmente. Eles não se excluem, mas partem de filosofias diferentes — a escolha depende principalmente do quanto você se sente à vontade usando um terminal e do que pretende fazer com o modelo depois de instalado.

LM Studio — sem terminal
aplicativo de desktop com interface gráfica completa, pesquisa de modelos integrada e ajustes de GPU pela interface gráfica. A opção mais direta para o primeiro contato, disponível no Windows, macOS (Apple Silicon) e Linux.
Ollama — terminal e API
Instalação com um único comando, biblioteca de modelos controlada via linha de comando, servidor de API local compatível com a OpenAI ativo por padrão. A escolha natural se você pretende escrever scripts, automatizar ou conectar uma ferramenta de terceiros.
llama.cpp — para os especialistas
o motor de inferência que muitas outras ferramentas usam nos bastidores, incluindo o LM Studio. Compilação a partir do código-fonte, controle preciso de cada parâmetro, nenhuma interface — reservado para quem quer entender ou otimizar cada detalhe.

Resumo: você não quer abrir nenhum terminal → LM Studio. Você quer chamar seu modelo a partir de um script, automação ou aplicação → Ollama. Você quer entender ou ajustar cada parâmetro de compilação, ou rodar o modelo em um hardware inusitado → llama.cpp.


#Instalação rápida, passo a passo

A seguir, uma instalação resumida para cada um dos três caminhos. A ideia é dar uma visão geral para começar em poucos minutos; há um guia específico para cada ferramenta com todos os detalhes, incluindo capturas de tela.

Com LM Studio (sem usar o terminal):

  1. 01
    1. Baixar o instalador
    No site oficial de LM Studio, baixe a versão compatível com seu sistema.
  2. 02
    2. Abrir a busca de modelos
    Na primeira execução, abra a aba de pesquisa (atalho Ctrl/Cmd+Shift+M) para navegar pelo catálogo.
  3. 03
    3. Escolher um modelo adequado
    A aplicação exibe uma estimativa de compatibilidade com VRAM antes do download: prefira um modelo marcado como compatível com sua máquina.
  4. 04
    4. Carregar o modelo e conversar
    Abra a aba Chat, carregue o modelo baixado no menu superior e faça sua primeira pergunta.

Com Ollama (terminal e API):

  1. 01
    1. Instalar o Ollama
    Script oficial no Linux, instalador .exe ou .dmg no Windows e no macOS. O aplicativo de desktop inicia automaticamente após a instalação.
  2. 02
    2. Iniciar um primeiro modelo
    Em um terminal, o comando ollama run suivie com o nome de um modelo o baixa e inicia um chat diretamente no terminal.
  3. 03
    3. Conversar ou conectar uma ferramenta de terceiros
    Continue no terminal, ou aponte uma aplicação compatível com OpenAI para o servidor API local (porta 11434 por padrão).
  4. 04
    4. Gerenciar seus modelos instalados
    Liste, altere ou remova seus modelos a qualquer momento com os comandos de gerenciamento dedicados.

Com llama.cpp (especialistas):

  1. 01
    1. Compilar o binário
    Clone o repositório e compile para o seu hardware (CPU, CUDA, Metal ou ROCm, conforme sua configuração).
  2. 02
    2. Baixar um modelo GGUF
    Baixe um arquivo no formato GGUF do Hugging Face, escolhendo a quantização adequada à memória disponível.
  3. 03
    3. Executar o binário do chat
    Aponte para o arquivo GGUF baixado, com os parâmetros de contexto e de offload para a GPU de sua escolha.
  4. 04
    4. Ajustar o offload GPU/CPU
    Ajuste camada por camada a distribuição entre GPU e CPU para encontrar o melhor equilíbrio entre velocidade e memória na sua configuração.
i
Para o detalhamento completo
Cada um desses três caminhos merece seu próprio guia passo a passo, com capturas de tela e opções avançadas. Esta versão resumida basta para ter um primeiro modelo que responde; volte ao guia dedicado assim que quiser se aprofundar em um ponto específico, como o suporte a GPUs AMD ou a configuração de rede de um servidor.

#Baixar seu primeiro modelo

Um bom primeiro modelo depende principalmente do que sua máquina consegue manter confortavelmente na memória, e não da reputação do modelo. Veja aqui algumas referências confiáveis de acordo com sua configuração.

Máquina modesta (8-16 GB de RAM, sem GPU dedicada)
um pequeno modelo generalista, com cerca de 3 a 4B de parâmetros em Q4: rápido mesmo usando apenas a CPU, mais do que suficiente para conversar, resumir ou traduzir um texto curto.
8 a 12 GB de VRAM
um modelo de 7 a 8 bilhões em Q4_K_M, como o Qwen3 8B ou Mistral: o equilíbrio entre qualidade e velocidade mais comum para uso diário.
16-24 GB de VRAM
um modelo de 14B, ou um de 32B em Q4 se você estiver no limite superior dessa faixa, como o Gemma em sua maior versão: mais margem para raciocínio ou código.
Você ainda não sabe o que quer fazer com ele
comece pequeno. Verificar se um modelo leve responde corretamente leva alguns minutos; você passará para modelos maiores depois que o primeiro teste tiver sido bem-sucedido.
→
O nome da quantização não é um mero detalhe estético
Um rótulo como Q4_K_M, Q5_K_M ou Q8_0 indica o nível de compressão do modelo. Quanto menor o número, mais leve e rápido o modelo, mas menos preciso. Q4_K_M continua sendo o melhor ponto de partida para um primeiro teste.

#Erros comuns a evitar

A maioria das primeiras impressões negativas sobre IA local vem de um mau ajuste, e não de um problema real com a ferramenta ou o modelo. Aqui estão as armadilhas mais comuns para quem instala seu primeiro LLM localmente e como identificá-las rapidamente.

Modelo grande demais para a VRAM
o modelo passa a usar a RAM do sistema, podendo até travar ao carregar. As respostas ficam muito lentas ou aparece um erro de memória. Escolha um modelo de tamanho imediatamente menor ou reduza a quantização em um nível.
Quantização escolhida ao acaso
A versão mais pesada disponível, baixada “para ter o melhor”, muitas vezes acaba não cabendo na memória. Comece com Q4_K_M e só passe para uma versão mais pesada se a margem de memória realmente permitir.
Ventoinha que dispara e resposta que demora
normal ao usar um primeiro modelo grande: a inferência exige muito da GPU ou da CPU. Se estiver lento demais para você, isso indica que o modelo é grande demais para sua máquina, não um bug a corrigir.
Baixar tudo antes de testar
Melhor validar se um pequeno modelo funciona e responde corretamente antes de iniciar o download de um modelo de dezenas de GB.

#E depois? RAG, copiloto de código, API

Depois que um primeiro modelo estiver instalado e funcionando, há vários próximos passos naturais, dependendo do seu uso: conversar com seus próprios documentos, conectar um copiloto de código ao seu editor ou disponibilizar o servidor de API local para seus próprios scripts e aplicativos.

Conversar com seus documentos (RAG)
LM Studio oferece um RAG integrado pronto para uso. Com o Ollama, é necessário combinar uma ferramenta de terceiros, como Open WebUI, ou um pipeline dedicado para obter um resultado equivalente.
Usar um copiloto no seu editor de código
O servidor API compatível com OpenAI de Ollama ou LM Studio pode ser conectado a extensões como Cline para codificar com assistência 100% local.
Automatizar via API
as duas ferramentas expõem um servidor local compatível com a API da OpenAI, reutilizável em qualquer script ou aplicativo já projetado para essa API, sem precisar fazer alterações no lado do cliente.
→
Um passo de cada vez
Não há necessidade de buscar RAG, copiloto de código ou automação desde o primeiro dia. Valide primeiro um chat local que responda corretamente às suas perguntas; os usos mais avançados se construem naturalmente uma vez que essa base sólida esteja estabelecida.

#Perguntas frequentes

Instalar um LLM localmente é legal e gratuito?+
Sim: ferramentas como Ollama, LM Studio ou llama.cpp são gratuitas, e os modelos com pesos abertos (Llama, Qwen, Mistral, Gemma...) são publicados sob licenças que permitem o uso pessoal. Algumas licenças têm condições específicas para uso comercial em grande escala, que devem ser verificadas caso a caso na página do modelo.
Qual configuração mínima para começar?+
Na prática, 16 GB de RAM e um processador recente são suficientes para um modelo inicial com alguns bilhões de parâmetros. Uma GPU com pelo menos 8 GB de VRAM, ou um chip Apple Silicon com memória unificada suficiente, torna a experiência muito mais confortável à medida que você passa a usar modelos maiores.
É possível instalar um LLM localmente sem placa de vídeo?+
Sim, os três métodos apresentados aqui funcionam apenas com CPU. Os modelos de 3 a 8B continuam utilizáveis sem GPU, mas as respostas são mais lentas do que com uma placa dedicada.
Quanto espaço em disco é necessário reservar?+
Cada modelo quantizado ocupa de algumas centenas de MB, no caso dos menores, a várias dezenas de GB, no caso dos maiores. Reserve uma margem confortável em um SSD se planeja testar vários modelos antes de se decidir.
Qual modelo escolher para começar?+
Um modelo generalista de 7 a 8B, como o Qwen3 8B ou o Mistral, com quantização Q4_K_M, é um bom ponto de partida na maioria das máquinas recentes. Ajuste depois o tamanho conforme sua RAM ou VRAM real e seus primeiros testes.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.