LLM: O que é? Definição simples e fonctionnement
O que é um LLM, afinal? Em uma frase: um programa que leu uma quantidade gigantesca de texto e, com base no que aprendeu, prevê a palavra seguinte mais plausível — e assim sucessivamente, até formar uma resposta. Este guia explica, sem jargões, como um grande modelo de linguagem é treinado, como ele gera texto token a token e a diferença entre um LLM na nuvem (ChatGPT, Gemini) e um LLM local que você pode rodar em sua própria máquina.
#O que é um LLM? A definição simples
LLM é a sigla de Large Language Model, em francês “grand modèle de langage” (grande modelo de linguagem). A palavra “large” (grande) se refere ao tamanho: esses modelos contêm bilhões de parâmetros, uma espécie de ajuste numérico feito durante o treinamento. “Language model” (modelo de linguagem) significa que o programa modela a linguagem: ele aprendeu o quanto uma determinada sequência de palavras é provável em uma determinada situação.
Concretamente, um LLM faz apenas uma coisa: a partir de um trecho de texto, ele prevê o que vem a seguir. Você escreve «A capital da França é», ele calcula que a palavra mais provável após essa frase é «Paris». Toda a magia aparente de um assistente como ChatGPT decorre dessa mecânica repetida milhares de vezes: escrever um e-mail, resumir um documento ou escrever código, nada disso é mais do que uma longa sequência de «qual é a palavra seguinte mais provável?».
#Tokens: como um LLM lê e escreve
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Um LLM não vê palavras nem letras como nós. Ele trabalha com tokens: fragmentos de texto. Um token pode ser uma palavra curta inteira (« chat »), um pedaço de palavra (« anti », « constitution »), um sinal de pontuação ou um espaço. Em média, em francês, um token corresponde a aproximadamente 3 ou 4 caracteres, ou seja, cerca de ¾ de uma palavra.
Antes de processar sua mensagem, o modelo a divide em tokens (chamamos isso de tokenização), depois converte cada token em uma lista de números. Todos os cálculos que ele faz são realizados sobre esses números. Quando responde, gera um token de cada vez, depois os reconverte em texto legível. É por isso que falamos de geração “token por token”.
- Token
- A unidade básica manipulada pelo modelo: uma palavra curta, uma parte de palavra ou um símbolo.
- Contexto
- A quantidade de tokens que o modelo pode 'manter em mente' de uma vez (pergunta + histórico + resposta). Fala-se de janela de contexto, geralmente 4.000, 32.000, ou até centenas de milhares de tokens.
- Dica prática
- Uma página de texto ≈ 500 a 700 tokens. 1.000 tokens ≈ 750 palavras. O faturamento na nuvem e a velocidade local são medidos em tokens.
#Treinamento: como um LLM aprende
Um LLM não é programado regra por regra. Ele é treinado. São apresentados a ele volumes imensos de texto (páginas web, livros, código, artigos), e pede-se que adivinhe a próxima palavra em cada ponto. No início, ele quase sempre erra. A cada erro, um algoritmo ajusta levemente seus bilhões de parâmetros para que a próxima previsão seja um pouco melhor. Repetido bilhões de vezes, esse processo gera uma compreensão estatística da gramática, dos fatos e do raciocínio.
Esta fase ocorre em duas grandes etapas. O pré-treinamento constrói o conhecimento geral do modelo a partir do texto bruto. Em seguida, um ajuste fino (fine-tuning) e um alinhamento ensinam o modelo a seguir instruções e a responder de forma útil e educada, muitas vezes com a ajuda de feedback humano. Um modelo “instruct” ou “chat” passou por essa segunda etapa; é esse que se usa para conversar.
- Parâmetros (os « bilhões »)
- As configurações internas ajustadas durante o treinamento. Um modelo « 7B » tem 7 bilhões de parâmetros, um « 70B » tem 70 bilhões. Quanto mais parâmetros, mais capaz ele é — e mais memória ele exige.
- Pesos (weights)
- Outro nome dos parâmetros, uma vez fixados. Baixar um modelo é baixar seus pesos: um grande arquivo de vários gigabytes.
- Dados de treinamento
- O texto lido durante o treinamento. O modelo não o 'armazena' palavra por palavra: ele retém regularidades estatísticas.
#Inferência: gerar texto token a token
Depois de treinado, o uso do modelo recebe o nome de inferência. Você envia um texto (o prompt), e o modelo produz sua resposta um token de cada vez. Este é o ciclo exato: ele lê todo o texto disponível, calcula o próximo token mais provável, adiciona esse token à sequência, relê tudo — o prompt mais o novo token — e recomeça. Ele para quando gera um token especial de fim ou atinge o limite definido.
Por isso, em uma interface de chat, a resposta aparece palavra por palavra em tempo real: você assiste literalmente à geração. A velocidade é medida em tokens por segundo. Em um LLM local, ela depende do seu hardware — um bom GPU gera dezenas de tokens por segundo, um processador sozinho muito menos.
O modelo não escolhe sempre o token mais provável de forma rígida. Um ajuste chamado temperatura introduz um grau de aleatoriedade controlada: quando a temperatura é baixa, as respostas são previsíveis e factuais; quando é alta, são mais criativas e variadas. É esse mesmo mecanismo que explica por que um LLM pode dar duas respostas diferentes para a mesma pergunta.
#O que um LLM não é
Entender como o modelo funciona evita mal-entendidos comuns. Um LLM não é uma base de dados: ele não procura uma resposta armazenada, ele a reconstrói estatisticamente. Ele não está conectado à internet por padrão: ele só conhece o que já leu até a data de treinamento, a menos que seja conectado a uma ferramenta de pesquisa ou ao RAG. E ele não 'entende' no sentido humano: ele modela a linguagem extremamente bem, o que é suficiente para ser útil, mas continua sendo uma previsão, não uma consciência.
#LLM na nuvem vs LLM local: a verdadeira diferença
Existem duas formas de usar um LLM. No caso de um LLM em nuvem, o modelo roda nos servidores de uma empresa (OpenAI para ChatGPT, Google para Gemini, Anthropic para Claude). Você envia seu texto pela internet, as GPUs da empresa calculam a resposta e a enviam de volta para você. Você não baixa nada; em troca, seus dados passam por um terceiro e você depende de uma assinatura e de uma conexão.
No caso de um LLM local, você baixa os pesos de um modelo com pesos abertos (Llama, Qwen, Mistral, Gemma…) e o executa no seu próprio computador. A inferência acontece inteiramente na sua máquina: nenhum dado sai, não há assinatura e tudo funciona mesmo sem conexão. A contrapartida é que você precisa de hardware suficiente e que os melhores modelos abertos muitas vezes ainda ficam um nível abaixo dos maiores modelos proprietários na nuvem.
- Privacidade
- Nuvem: seus prompts são enviados ao provedor. Local: tudo permanece na sua máquina.
- Custo
- Nuvem: assinatura mensal ou pagamento por token. Local: gratuito para uso, uma vez que o hardware for adquirido.
- Offline
- Nuvem: conexão obrigatória. Local: funciona sem internet depois que o modelo é baixado.
- Potência
- Nuvem: acesso aos maiores modelos sem necessidade de hardware. Local: limitado pela sua GPU/RAM, mas já bastante capaz com uma placa de 12 GB.
- Controle
- Nuvem: o fornecedor pode mudar o modelo ou as regras. Local: o modelo é seu e não muda sem seu consentimento.
#Por que o LLM local existe
Se a nuvem é tão prática, por que rodar um LLM em casa? Três razões principais. Primeiro, a confidencialidade: documentos médicos, contratos, código proprietário, anotações pessoais — muitas pessoas e empresas se recusam a enviar esses conteúdos para servidores de terceiros. Depois, a independência: sem assinatura, sem limite de mensagens, sem interrupção se o serviço mudar de preço ou desaparecer. E o controle técnico: um modelo local pode ser ajustado, integrado às suas próprias ferramentas e funciona tanto em um avião quanto em uma área sem rede.
O que tornou tudo isso possível foi a quantização: uma técnica que compacta os pesos do modelo para que caibam na memória sem perder muito em qualidade. Graças a ela, um modelo que exigia um servidor agora pode rodar em um PC gamer. O formato Q4_K_M é o equilíbrio recomendado para começar; Q5_K_M, Q8_0 e FP16 oferecem mais precisão ao custo de mais memória.
#Experimentar um LLM em casa em 10 minutos
A melhor forma de entender um LLM é executar um. A stack mais simples consiste em dois elementos: Ollama, um daemon que baixa e executa os modelos (fica à escuta em http://localhost:11434), e uma interface como Open WebUI ou LM Studio para conversar em uma janela de chat. Veja a sequência mínima na linha de comando, com um modelo pequeno que roda mesmo sem GPU dedicada.
- 01Instalar OllamaBaixe o instalador de ollama.com para Windows, macOS ou Linux e execute-o. Após a instalação, Ollama roda em segundo plano e expõe sua API local na porta 11434.
- 02Baixar e iniciar um modeloUm único comando obtém os pesos e depois abre o chat diretamente no terminal. A primeira execução baixa alguns gigabytes; as seguintes são instantâneas.
- 03ConversarPergunte algo e observe a resposta aparecendo token a token: você vê a inferência em tempo real. Digite /bye para encerrar a conversa.
- 04Verificar se tudo é executado localmenteDesligue o Wi-Fi e repita uma pergunta. O modelo continua respondendo: a prova de que o cálculo é feito 100% na sua máquina.
#Para se aprofundar
Você sabe agora o que é um LLM e como ele funciona. Esses guias complementam cada conceito abordado aqui:
- Iniciar com Ollama
- “Ollama: o que é e como funciona” detalha a instalação, os comandos básicos (run, pull, list) e o equipamento necessário para começar.
- Entender os tokens
- « Entender a janela de contexto » explica como o modelo « vê » suas mensagens e por que esquece conversas longas.
- Escolher sua quantização
- “Escolher a quantização (Q4, Q5, Q8, FP16)” ajuda a encontrar o equilíbrio adequado entre qualidade e memória para a sua placa.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.