Iniciante 9 minFundamentos

LLM: O que é? Definição simples e fonctionnement

O que é um LLM, afinal? Em uma frase: um programa que leu uma quantidade gigantesca de texto e, com base no que aprendeu, prevê a palavra seguinte mais plausível — e assim sucessivamente, até formar uma resposta. Este guia explica, sem jargões, como um grande modelo de linguagem é treinado, como ele gera texto token a token e a diferença entre um LLM na nuvem (ChatGPT, Gemini) e um LLM local que você pode rodar em sua própria máquina.

Por Mohamed Meguedmi·Atualização 2026-09-02·Testado no Windows, macOS e Linux

#O que é um LLM? A definição simples

LLM é a sigla de Large Language Model, em francês “grand modèle de langage” (grande modelo de linguagem). A palavra “large” (grande) se refere ao tamanho: esses modelos contêm bilhões de parâmetros, uma espécie de ajuste numérico feito durante o treinamento. “Language model” (modelo de linguagem) significa que o programa modela a linguagem: ele aprendeu o quanto uma determinada sequência de palavras é provável em uma determinada situação.

Concretamente, um LLM faz apenas uma coisa: a partir de um trecho de texto, ele prevê o que vem a seguir. Você escreve «A capital da França é», ele calcula que a palavra mais provável após essa frase é «Paris». Toda a magia aparente de um assistente como ChatGPT decorre dessa mecânica repetida milhares de vezes: escrever um e-mail, resumir um documento ou escrever código, nada disso é mais do que uma longa sequência de «qual é a palavra seguinte mais provável?».

i
Em uma imagem
Imagine a digitação preditiva do seu celular, mas treinada com trilhões de palavras em vez de suas mensagens SMS. Um LLM é esse teclado preditivo levado ao extremo — poderoso o suficiente para manter uma conversa coerente.

#Tokens: como um LLM lê e escreve

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Um LLM não vê palavras nem letras como nós. Ele trabalha com tokens: fragmentos de texto. Um token pode ser uma palavra curta inteira (« chat »), um pedaço de palavra (« anti », « constitution »), um sinal de pontuação ou um espaço. Em média, em francês, um token corresponde a aproximadamente 3 ou 4 caracteres, ou seja, cerca de ¾ de uma palavra.

Antes de processar sua mensagem, o modelo a divide em tokens (chamamos isso de tokenização), depois converte cada token em uma lista de números. Todos os cálculos que ele faz são realizados sobre esses números. Quando responde, gera um token de cada vez, depois os reconverte em texto legível. É por isso que falamos de geração “token por token”.

Token
A unidade básica manipulada pelo modelo: uma palavra curta, uma parte de palavra ou um símbolo.
Contexto
A quantidade de tokens que o modelo pode 'manter em mente' de uma vez (pergunta + histórico + resposta). Fala-se de janela de contexto, geralmente 4.000, 32.000, ou até centenas de milhares de tokens.
Dica prática
Uma página de texto ≈ 500 a 700 tokens. 1.000 tokens ≈ 750 palavras. O faturamento na nuvem e a velocidade local são medidos em tokens.
→
Por que isso importa
A janela de contexto é uma limitação física: se seu documento ultrapassar o tamanho do contexto, o modelo verá apenas uma parte dele. Entender os tokens ajuda a saber por que um LLM "esquece" o início de uma conversa muito longa.

#Treinamento: como um LLM aprende

Um LLM não é programado regra por regra. Ele é treinado. São apresentados a ele volumes imensos de texto (páginas web, livros, código, artigos), e pede-se que adivinhe a próxima palavra em cada ponto. No início, ele quase sempre erra. A cada erro, um algoritmo ajusta levemente seus bilhões de parâmetros para que a próxima previsão seja um pouco melhor. Repetido bilhões de vezes, esse processo gera uma compreensão estatística da gramática, dos fatos e do raciocínio.

Esta fase ocorre em duas grandes etapas. O pré-treinamento constrói o conhecimento geral do modelo a partir do texto bruto. Em seguida, um ajuste fino (fine-tuning) e um alinhamento ensinam o modelo a seguir instruções e a responder de forma útil e educada, muitas vezes com a ajuda de feedback humano. Um modelo “instruct” ou “chat” passou por essa segunda etapa; é esse que se usa para conversar.

Parâmetros (os « bilhões »)
As configurações internas ajustadas durante o treinamento. Um modelo « 7B » tem 7 bilhões de parâmetros, um « 70B » tem 70 bilhões. Quanto mais parâmetros, mais capaz ele é — e mais memória ele exige.
Pesos (weights)
Outro nome dos parâmetros, uma vez fixados. Baixar um modelo é baixar seus pesos: um grande arquivo de vários gigabytes.
Dados de treinamento
O texto lido durante o treinamento. O modelo não o 'armazena' palavra por palavra: ele retém regularidades estatísticas.
i
Treinamento ≠ uso
O treinamento custa milhões de euros e semanas de processamento em milhares de GPUs: ninguém o refaz em casa. Depois que os pesos são publicados, porém, usá-los (a inferência) é possível em um simples PC. Essa é a grande promessa do LLM local.

#Inferência: gerar texto token a token

Depois de treinado, o uso do modelo recebe o nome de inferência. Você envia um texto (o prompt), e o modelo produz sua resposta um token de cada vez. Este é o ciclo exato: ele lê todo o texto disponível, calcula o próximo token mais provável, adiciona esse token à sequência, relê tudo — o prompt mais o novo token — e recomeça. Ele para quando gera um token especial de fim ou atinge o limite definido.

Por isso, em uma interface de chat, a resposta aparece palavra por palavra em tempo real: você assiste literalmente à geração. A velocidade é medida em tokens por segundo. Em um LLM local, ela depende do seu hardware — um bom GPU gera dezenas de tokens por segundo, um processador sozinho muito menos.

O modelo não escolhe sempre o token mais provável de forma rígida. Um ajuste chamado temperatura introduz um grau de aleatoriedade controlada: quando a temperatura é baixa, as respostas são previsíveis e factuais; quando é alta, são mais criativas e variadas. É esse mesmo mecanismo que explica por que um LLM pode dar duas respostas diferentes para a mesma pergunta.

!
A armadilha das alucinações
Um LLM prevê o que é plausível, não o que é verdadeiro. Quando ele não “sabe”, ainda assim gera a continuação mais provável — que pode ser falsa, mas formulada com confiança. É o que se chama de alucinação: algo a ter sempre em mente ao lidar com fatos, números e citações.

#O que um LLM não é

Entender como o modelo funciona evita mal-entendidos comuns. Um LLM não é uma base de dados: ele não procura uma resposta armazenada, ele a reconstrói estatisticamente. Ele não está conectado à internet por padrão: ele só conhece o que já leu até a data de treinamento, a menos que seja conectado a uma ferramenta de pesquisa ou ao RAG. E ele não 'entende' no sentido humano: ele modela a linguagem extremamente bem, o que é suficiente para ser útil, mas continua sendo uma previsão, não uma consciência.


#LLM na nuvem vs LLM local: a verdadeira diferença

Existem duas formas de usar um LLM. No caso de um LLM em nuvem, o modelo roda nos servidores de uma empresa (OpenAI para ChatGPT, Google para Gemini, Anthropic para Claude). Você envia seu texto pela internet, as GPUs da empresa calculam a resposta e a enviam de volta para você. Você não baixa nada; em troca, seus dados passam por um terceiro e você depende de uma assinatura e de uma conexão.

No caso de um LLM local, você baixa os pesos de um modelo com pesos abertos (Llama, Qwen, Mistral, Gemma…) e o executa no seu próprio computador. A inferência acontece inteiramente na sua máquina: nenhum dado sai, não há assinatura e tudo funciona mesmo sem conexão. A contrapartida é que você precisa de hardware suficiente e que os melhores modelos abertos muitas vezes ainda ficam um nível abaixo dos maiores modelos proprietários na nuvem.

Privacidade
Nuvem: seus prompts são enviados ao provedor. Local: tudo permanece na sua máquina.
Custo
Nuvem: assinatura mensal ou pagamento por token. Local: gratuito para uso, uma vez que o hardware for adquirido.
Offline
Nuvem: conexão obrigatória. Local: funciona sem internet depois que o modelo é baixado.
Potência
Nuvem: acesso aos maiores modelos sem necessidade de hardware. Local: limitado pela sua GPU/RAM, mas já bastante capaz com uma placa de 12 GB.
Controle
Nuvem: o fornecedor pode mudar o modelo ou as regras. Local: o modelo é seu e não muda sem seu consentimento.

#Por que o LLM local existe

Se a nuvem é tão prática, por que rodar um LLM em casa? Três razões principais. Primeiro, a confidencialidade: documentos médicos, contratos, código proprietário, anotações pessoais — muitas pessoas e empresas se recusam a enviar esses conteúdos para servidores de terceiros. Depois, a independência: sem assinatura, sem limite de mensagens, sem interrupção se o serviço mudar de preço ou desaparecer. E o controle técnico: um modelo local pode ser ajustado, integrado às suas próprias ferramentas e funciona tanto em um avião quanto em uma área sem rede.

O que tornou tudo isso possível foi a quantização: uma técnica que compacta os pesos do modelo para que caibam na memória sem perder muito em qualidade. Graças a ela, um modelo que exigia um servidor agora pode rodar em um PC gamer. O formato Q4_K_M é o equilíbrio recomendado para começar; Q5_K_M, Q8_0 e FP16 oferecem mais precisão ao custo de mais memória.

i
Referência de VRAM em Q4
Quanta memória é necessária para cada modelo? 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Uma RTX 3060 de 12 GB executa confortavelmente um modelo de 7B ou 14B; uma RTX 4090 de 24 GB ou um Mac Apple Silicon de 48 GB são opções voltadas aos modelos grandes.

#Experimentar um LLM em casa em 10 minutos

A melhor forma de entender um LLM é executar um. A stack mais simples consiste em dois elementos: Ollama, um daemon que baixa e executa os modelos (fica à escuta em http://localhost:11434), e uma interface como Open WebUI ou LM Studio para conversar em uma janela de chat. Veja a sequência mínima na linha de comando, com um modelo pequeno que roda mesmo sem GPU dedicada.

  1. 01
    Instalar Ollama
    Baixe o instalador de ollama.com para Windows, macOS ou Linux e execute-o. Após a instalação, Ollama roda em segundo plano e expõe sua API local na porta 11434.
  2. 02
    Baixar e iniciar um modelo
    Um único comando obtém os pesos e depois abre o chat diretamente no terminal. A primeira execução baixa alguns gigabytes; as seguintes são instantâneas.
  3. 03
    Conversar
    Pergunte algo e observe a resposta aparecendo token a token: você vê a inferência em tempo real. Digite /bye para encerrar a conversa.
  4. 04
    Verificar se tudo é executado localmente
    Desligue o Wi-Fi e repita uma pergunta. O modelo continua respondendo: a prova de que o cálculo é feito 100% na sua máquina.
Terminal
# Lancer un petit modèle rapide (≈2 Go, tourne même sans GPU)
ollama run llama3.2:3b

# Pour un modèle plus capable si vous avez ~5 Go de VRAM
ollama run qwen3

# Vérifier les modèles installés et que le daemon répond
ollama list
curl http://localhost:11434/api/tags
→
Os nomes das tags evoluem
As tags exatas (llama3.2:3b, qwen3…) e os tamanhos disponíveis mudam regularmente na biblioteca Ollama. Consulte ollama.com/library para verificar o nome preciso e o tamanho em GB de cada variante antes de baixar.

#Para se aprofundar

Você sabe agora o que é um LLM e como ele funciona. Esses guias complementam cada conceito abordado aqui:

Iniciar com Ollama
“Ollama: o que é e como funciona” detalha a instalação, os comandos básicos (run, pull, list) e o equipamento necessário para começar.
Entender os tokens
« Entender a janela de contexto » explica como o modelo « vê » suas mensagens e por que esquece conversas longas.
Escolher sua quantização
“Escolher a quantização (Q4, Q5, Q8, FP16)” ajuda a encontrar o equilíbrio adequado entre qualidade e memória para a sua placa.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.