Iniciante 8 minConceitos

LLM 7B, 30B, 70B: o que significam esses tamanhos ?

No Hugging Face ou no Ollama, cada modelo traz um número: 1B, 7B, 32B, 70B. Esse número — os bilhões de parâmetros — determina o que o modelo sabe fazer, a VRAM que exige e sua velocidade. Mas um LLM de 7B recente pode superar um de 70B de dois anos atrás, e “maior” não significa “melhor para você”. Este guia explica o que é um parâmetro, o que cada nível realmente oferece e como decidir entre tamanho, quantização e hardware sem se deixar enganar pelo marketing.

Por Clara M.·Atualização 2026-09-21·Testado no Windows, macOS e Linux

#O que é exatamente um parâmetro

Um parâmetro é um número. Nada além disso: um valor numérico, geralmente codificado em 16 bits, aprendido durante o treinamento. Um modelo «7B» contém 7 bilhões deles. Esses números são os pesos das conexões entre os neurônios artificiais da rede — eles codificam tudo o que o modelo «sabe»: a gramática, os fatos, as formulações e as associações de ideias.

A analogia mais precisa é a das sinapses. Um parâmetro é como a força de uma conexão entre dois neurônios do cérebro. Quanto mais conexões, mais a rede pode memorizar nuances e padrões sutis. Um modelo de 1 bilhão de parâmetros tem cerca de 1 bilhão desses ajustes; um 70B tem setenta vezes mais. Cada parâmetro é minúsculo e, isoladamente, não tem inteligência; são o número e o arranjo deles que produzem a linguagem.

i
Por que o « B »
O B significa billion em inglês, ou seja, um bilhão. 7B = 7 bilhões de parâmetros. Esse número não diz nada sobre a qualidade dos dados de treinamento nem sobre a arquitetura — apenas sobre o tamanho bruto da rede.

Na prática, esses parâmetros ocupam espaço. Em 16 bits (FP16), cada parâmetro pesa 2 bytes: um modelo 7B ocupa, portanto, aproximadamente 14 GB em precisão total. É esse tamanho no disco e na memória que determina se o modelo cabe na sua máquina — voltaremos a isso ao falar de quantização, que comprime esses pesos.

#A escala real das capacidades, de 1B a 70B

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

As capacidades não aumentam de forma linear com o tamanho: elas avançam por patamares. Acima de um determinado limiar de parâmetros, novas habilidades surgem de repente — é o que se chama de capacidades emergentes. Veja o que observamos na prática com os modelos recentes.

1B – 3B
Completação de texto, reformulação simples, classificação, extração de palavras-chave. Útil em dispositivos móveis ou em edge, mas com raciocínio frágil e alucinações frequentes assim que a tarefa fica mais complexa.
7B – 8B
O primeiro nível realmente útil. Conversa coerente, resumo confiável, código simples, capacidade adequada de seguir instruções. É a porta de entrada para o uso sério de LLMs locais.
13B – 14B
Melhor desempenho em tarefas longas, menos erros factuais, código mais sólido. Um nível acima do 7B em refinamento, sem aumentar drasticamente o consumo de VRAM.
30B – 34B
Raciocínio em múltiplas etapas mais confiável, nuances nas respostas, boa qualidade de código e tradução. O ponto ideal entre qualidade e custo para um uso local exigente.
70B
O que há de melhor no segmento de consumo. Raciocínio próximo ao dos modelos na nuvem em muitas tarefas, respostas detalhadas e cheias de nuances. Exige uma configuração robusta ou offload.

Vale lembrar: cada duplicação de tamanho traz um ganho real, mas decrescente. O salto de 1B para 7B é espetacular; o de 30B para 70B é real, mas muito mais sutil, e só faz sentido se a sua tarefa precisar desse ganho.

#O que um LLM 7B sabe fazer que um 1B não sabe

É a comparação mais esclarecedora, porque a diferença é enorme para uma diferença de tamanho aparentemente modesta. Um modelo de 1B repete padrões; um de 7B começa a raciocinar. A passagem de um para o outro libera habilidades concretas que você percebe imediatamente no uso.

Seguir uma instrução em várias partes
Um modelo de 1B frequentemente esquece a segunda metade da sua solicitação. Um modelo de 7B consegue seguir uma instrução do tipo « resuma esse texto em 3 pontos, depois traduza-os para o inglês ».
Raciocínio em cadeia
Um problema lógico ou matemático com duas ou três etapas continua fora do alcance de um 1B; um 7B o decompõe corretamente em boa parte dos casos.
Coerência em um texto longo
O 1B perde o fio depois de alguns parágrafos. O 7B mantém o contexto, o tom e os nomes próprios em uma resposta completa.
Código funcional
Um 7B especializado escreve funções corretas e corrige bugs simples; um 1B produz principalmente código que “parece” código.
Menos alucinações
Sem eliminá-las, o 7B inventa bem menos e sabe dizer com mais frequência que não sabe.
→
O limite de 7B
Se sua máquina permitir, comece sempre com um 7B/8B em vez de um 3B. O ganho de confiabilidade é desproporcional em relação ao custo adicional de VRAM (cerca de 5 GB em Q4).

#Tamanho e VRAM: a tabela que importa

A questão prática não é «qual é o melhor modelo», mas «qual modelo cabe na minha placa». A VRAM necessária acompanha diretamente o número de parâmetros. Estes são os valores de referência na quantização Q4_K_M, o formato recomendado por padrão, que reduz o tamanho em aproximadamente quatro vezes em relação ao FP16.

3B ≈ 2 GB
Funciona em qualquer lugar, mesmo em uma placa de vídeo de entrada ou na CPU. Ideal para dispositivos móveis e tarefas simples.
7B ≈ 5 GB
Confortável em uma RTX 3060 12 GB ou uma RTX 4070 12 GB. A melhor relação entre capacidade e acessibilidade.
14B ≈ 9 GB
Cabe em 12 GB de VRAM com um contexto razoável e roda com folga em 16 GB.
32B ≈ 19 GB
Procure uma RTX 4090 de 24 GB ou uma placa de 16 GB com um pouco de offload para a RAM.
70B ≈ 40 GB
Fora do alcance de uma única placa de consumo: duas GPUs, offload para RAM/SSD ou um Mac com Apple Silicon e bastante memória unificada (M4 Pro 48 GB).
!
Não esquecer o contexto
Esses números abrangem apenas os pesos do modelo. A janela de contexto (o cache KV) consome VRAM adicional, e esse consumo aumenta quanto maior ela for. Reserve uma margem de 1 a alguns GB acima do tamanho do modelo.

#Tamanho versus quantização: a verdadeira escolha entre os dois

Quando a VRAM é limitada, você tem duas opções: escolher um modelo menor ou um modelo maior, mas mais comprimido. A quantização reduz a precisão dos parâmetros — de 16 bits para 4 ou 8 bits — para fazer o modelo caber em menos memória, ao custo de uma leve perda de qualidade.

A regra empírica validada pelo uso: um modelo maior, com quantização mais agressiva, quase sempre supera um modelo menor em precisão plena, com a mesma VRAM. Um 13B em Q4 cabe na mesma memória que um 7B em Q8 e geralmente se mostra mais capaz. O número de parâmetros pesa mais que os últimos bits de precisão.

Q4_K_M
O padrão recomendado. Perda mínima de qualidade, memória reduzida em ~4 vezes. A escolha padrão para quase todos os usos.
Q5_K_M
Um nível acima em qualidade por um pouco mais de VRAM. Bom compromisso se a memória permitir.
Q8_0
Quase indistinguível do FP16. Reservar para modelos pequenos ou placas com muita memória.
FP16
Precisão total, duas vezes mais pesado que Q8. Útil principalmente para fine-tuning, raramente necessário para inferência.
→
A escolha em uma frase
Com a mesma memória, prefira um modelo maior em Q4 a um modelo menor em Q8. Não desça abaixo de Q4, salvo necessidade: abaixo disso, a qualidade cai rapidamente.

#Por que um modelo pequeno e recente supera um modelo grande e antigo

Este é o ponto que mais confunde os iniciantes: um LLM 7B de 2026 pode superar um 70B de 2023. O tamanho é apenas um dos fatores da qualidade — e nem sempre o mais decisivo. Outros três fatores evoluíram enormemente.

Qualidade dos dados
Os modelos recentes são treinados com corpus mais bem filtrados, deduplicados e enriquecidos com dados sintéticos de alta qualidade. Com o mesmo tamanho, aprendem muito mais.
Volume de treinamento
Os modelos 7B modernos veem dezenas de trilhões de tokens, muito mais do que os grandes modelos antigos. Uma rede pequena muito treinada supera uma rede grande insuficientemente treinada.
Arquitetura e pós-treinamento
Melhores arquiteturas, alinhamento por RLHF, treinamento específico para raciocínio: todos esses são ganhos que nada têm a ver com o número de parâmetros.

A distilação também desempenha um papel-chave: transfere-se o conhecimento de um modelo muito grande para um pequeno, que herda parte de suas capacidades com uma fração do tamanho. Assim, um 7B ou 8B distilado raciocina como um modelo muito mais pesado. Consequência prática: sempre olhe para a data de lançamento e os benchmarks recentes, nunca apenas o número de parâmetros.

!
A armadilha do marketing
“Maior = melhor” não é uma verdade absoluta. A qualidade de um modelo depende tanto dos seus dados, do seu treinamento e da sua arquitetura quanto do seu tamanho. Desconfie de comparações que apenas colocam lado a lado os bilhões de parâmetros.

#Escolher o tamanho na prática

O tamanho ideal é aquele que cabe no seu hardware e atende ao seu uso. Comece com o maior modelo recente que sua VRAM comporta em Q4, depois ajuste conforme a necessidade real de velocidade ou de refinamento.

  1. 01
    Meça sua VRAM
    Identifique a memória da sua GPU (ou a RAM unificada no Mac). Esse é o limite máximo que elimina de imediato os modelos grandes demais.
  2. 02
    Busque o maior modelo recente que caiba em Q4
    Com 12 GB, um modelo 14B recente. Com 24 GB, um modelo 32B. Com 8 GB, um bom 7B/8B. Sempre prefira um modelo recém-lançado a um modelo antigo maior.
  3. 03
    Ajuste de acordo com o uso
    Conversas do dia a dia e velocidade: fique na faixa de 7B–14B. Raciocínio, tarefas exigentes de programação, tradução precisa: passe para 30B+ se a memória permitir.
  4. 04
    Verifique a velocidade
    Se a taxa de geração em tokens por segundo frustrar você, desça um nível. Um 7B rápido costuma superar um 32B lento para uso interativo.

#Comparar dois tamanhos em 5 minutos

A melhor maneira de perceber a diferença é executar modelos de dois tamanhos lado a lado na sua própria máquina. Se o Ollama estiver instalado e escutando na porta padrão (http://localhost:11434), bastam dois comandos.

Terminal
# Un petit modèle rapide
ollama run llama3.2:3b --verbose

# Le même prompt sur un modèle plus gros
ollama run llama3.1:8b --verbose

Faça a mesma pergunta de raciocínio aos dois (por exemplo, um pequeno problema lógico em várias etapas) e compare a qualidade das respostas e a taxa de geração exibida por --verbose. Você verá concretamente qual é o equilíbrio entre capacidade e velocidade no seu hardware.

i
Ler os tokens por segundo
A opção --verbose exibe, no final da resposta, o número de tokens por segundo. É a medida objetiva para decidir entre dois tamanhos na sua própria GPU.

#Para se aprofundar

É mais fácil entender o tamanho ao relacioná-lo a outros conceitos básicos do uso local de modelos. Estes guias dão continuidade direta a este guia:

Escolher sua quantização (Q4, Q5, Q8, FP16)
A outra metade da decisão sobre memória: como compactar um modelo sem degradá-lo, com um guia visual.
MoE explicado: por que um 30B-A3B roda como um modelo pequeno
A notação com dois números que rompe a relação entre tamanho e velocidade, para ler logo depois deste guia.
Destilação: como os modelos pequenos herdam dos grandes
Para entender profundamente por que um modelo pequeno e recente pode superar um modelo grande e antigo.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.