Hugging Face: o que é e como usá-lo ?
O Hugging Face é a plataforma onde quase todos os modelos de IA abertos são publicados: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. A plataforma costuma ser descrita como o GitHub do machine learning: o repositório de onde vêm os arquivos, incluindo os que Ollama e LM Studio baixam para você. O Hub ultrapassou três milhões de modelos públicos em 18 de agosto de 2026, sem nenhuma seleção editorial.
O Hugging Face é a plataforma onde quase todos os modelos de IA abertos são publicados: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. Costuma-se dizer que é o GitHub do machine learning. Para quem roda uma IA em sua própria máquina, é o repositório de onde vêm todos os arquivos, incluindo os que Ollama e LM Studio baixam para você. O Hub ultrapassou oficialmente três milhões de modelos públicos em 18 de agosto de 2026, a um ritmo de cerca de 2.700 a 3.000 novos modelos por dia, sem nenhum filtro. Esta página ensina a interpretá-lo: qual repositório abrir, qual arquivo pegar para a sua placa de vídeo e o que verificar antes de clicar.
#O que é o Hugging Face?
Hugging Face é uma empresa fundada em 2016 por três empreendedores franceses, Clément Delangue, Julien Chaumond e Thomas Wolf, com operações em Nova York e Paris e sede nos Estados Unidos. Começou com um aplicativo de chatbot voltado para adolescentes, um projeto hoje abandonado, daí o nome inspirado no emoji que sorri com as mãos abertas. Em seguida, voltou-se para ferramentas open source para aprendizado de máquina: sua biblioteca transformers tornou-se a forma quase padrão de carregar e executar um modelo de linguagem em Python, adotada pela maioria dos laboratórios de pesquisa e das empresas do setor. Por fim, a empresa construiu o Hub, uma plataforma de hospedagem baseada no sistema de controle de versões Git, onde qualquer pessoa pode publicar gratuitamente modelos, conjuntos de dados e pequenas demonstrações web, sem validação editorial prévia.
Para a IA local, o Hub funciona como uma loja de aplicativos, com duas diferenças: quase tudo é gratuito e nada é selecionado para você. Diferentemente de uma loja de aplicativos tradicional, ninguém testa, aprova nem classifica os modelos antes da publicação: qualquer pessoa pode criar uma conta gratuita e disponibilizar um repositório em poucos minutos, sem validação nem controle de qualidade de qualquer tipo. Essa ausência total de filtro é, ao mesmo tempo, a força do Hub — tudo chega lá primeiro, muitas vezes antes mesmo do anúncio oficial de um laboratório — e sua principal armadilha para um iniciante, que pode se deparar com centenas de resultados de pesquisa sem saber qual é confiável. Saber se orientar, distinguir um repositório oficial de uma cópia de terceiros e uma conversão séria de uma tentativa abandonada é a habilidade a adquirir antes de baixar qualquer coisa.
#As três seções do Hub
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
| Seção | Conteúdo | Interesse pela IA local |
|---|---|---|
| Models | Arquivos de pesos, configuração, documentação | É aqui que está o arquivo que você vai rodar |
| Datasets | Dados de treinamento e avaliação | Apenas se você estiver fazendo fine-tuning ou testes |
| Spaces | Pequenas aplicações web, geralmente demonstrações | Experimentar um modelo no navegador antes de baixar 15 GB |
#Ler uma página do modelo
Cada modelo tem um endereço na forma huggingface.co/organisation/nom-du-modele, por exemplo huggingface.co/Qwen/Qwen3-8B. Quatro elementos distintos dessa página merecem sua atenção antes de qualquer download.
- Nome da organização
- Qwen, google, meta-llama, mistralai, openai, deepseek-ai são os próprios laboratórios, verificados. Qualquer outro nome indica um terceiro: às vezes excelente, mas nunca o original do laboratório.
- A ficha do modelo (model card)
- O arquivo README: o que é o modelo, como foi treinado, seus usos previstos, suas pontuações, seu formato de prompt e suas limitações. A qualidade varia: pode ser muito completo ou estar vazio.
- A licença
- Exibida em destaque no topo da página, ao lado do nome do modelo. Consultar a seção específica abaixo para saber o que cada licença comum realmente permite.
- A aba Files and versions
- A lista completa de arquivos disponíveis para download. Uma olhada rápida basta para saber imediatamente em que tipo de repositório você está.
#Qual repositório escolher: pesos originais ou GGUF
| O que você vê no Files | O que é | Para quais ferramentas | Tamanho para um modelo 8B |
|---|---|---|---|
| model-00001-of-00004.safetensors… | Pesos originais, em BF16, divididos em vários arquivos | transformers, vLLM, ferramentas de fine-tuning | ≈ 16 GB |
| …-Q4_K_M.gguf, …-Q8_0.gguf | Conversões quantizadas, um único arquivo por nível | Ollama, LM Studio, llama.cpp, KoboldCpp, Jan | ≈ 5 GB em Q4 |
| Repositórios …-AWQ, …-GPTQ, …-FP8 | Quantização pensada para servidores GPU | vLLM e motores equivalentes | ≈ 5 a 9 GB |
| Repositórios …-MLX-4bit | Formato Apple Silicon | MLX, LM Studio no Mac | ≈ 5 GB |
Os laboratórios publicam principalmente o primeiro tipo, os pesos originais como saem do treinamento. Os arquivos GGUF necessários para aplicativos de desktop são produzidos separadamente por conversores: alguns laboratórios publicam os seus diretamente, e contribuidores comunitários como bartowski, unsloth ou a organização ggml-org cobrem quase todo o restante, geralmente apenas algumas horas após um lançamento muito aguardado. Para encontrá-los sem procurar ao acaso, abra a página do modelo original e siga o link Quantizations na árvore do modelo, exibida à direita da página, ou busque simplesmente o nome do modelo seguido do termo GGUF na barra de pesquisa do Hub, que geralmente coloca as conversões mais baixadas no topo da lista.
#Escolher o arquivo correto para sua placa
Um repositório GGUF geralmente oferece cerca de uma dezena de arquivos para o mesmo modelo, um por nível de quantização disponível, do mais comprimido ao mais fiel. O tamanho do arquivo corresponde, aproximadamente, à VRAM que os pesos ocuparão quando o modelo for carregado na memória. Mantenha sempre de 1 a 3 GB de VRAM livres para o contexto da conversa e para a margem de funcionamento do sistema.
| Modelo | Q4_K_M | Q5_K_M | Q8_0 | BF16 | Placa de vídeo com folga para Q4 |
|---|---|---|---|---|---|
| Qwen 3 8B | 5 GB | 6 GB | 9 GB | 16 GB | 8 GB |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | 24 GB | 12 GB |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | 28 GB | 12 GB |
| gpt-oss 20B | 13 GB | 16 GB | 23 GB | 42 GB | 16 GB |
| Mistral Small 3.2 24B | 14 GB | 17 GB | 26 GB | 48 GB | 16 GB |
| Qwen 3.8 27B | 16 GB | 19 GB | 29 GB | 54 GB | 24 GB |
| Llama 3.3 70B | 40 GB | 48 GB | 75 GB | 140 GB | 2 × 24 GB |
- Q4, Q5, Q8 ou FP16: escolher a quantização
- VRAM: conhecer a sua e saber o que ela permite
- Calculadora de VRAM
#Três formas de baixar
A mais simples é deixar sua ferramenta cuidar disso. A busca do LM Studio consulta diretamente o Hugging Face e indica quais arquivos cabem na sua máquina. Tanto Ollama quanto llama.cpp conseguem baixar um repositório GGUF pelo nome.
O filtro --include é importante: sem ele, você baixa todas as quantizações do repositório, muitas vezes mais de 100 GB. Terceira opção, o navegador: aba Files and versions, seta de download ao lado do arquivo. Prático para um GGUF isolado, inadequado para os pesos originais divididos em vários arquivos.
#Licenças: aberto não significa sem condições
| Licença | Exemplos do catálogo | Uso comercial |
|---|---|---|
| Apache 2.0 | Família Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2 | Sim, com menção |
| MIT | Destilações DeepSeek R1, GLM 4.7 Flash | Sim |
| Licença Llama Community | Llama 3.3 70B | Sim, com condições: regras de nomenclatura, política de uso, limite de usuários |
| Não comercial, pesquisa | Várias publicações de pesquisa | Não |
A indicação exibida na ficha do modelo prevalece em caso de dúvida, e um modelo derivado, ajustado por fine-tuning ou resultante da fusão com outro geralmente herda as obrigações do seu modelo de base, mesmo quando o README do derivado não menciona isso explicitamente. Para uma implantação em uma empresa ou em um produto comercial, esses dois minutos de leitura atenta da licença evitam construir toda uma integração com um modelo cujo uso comercial é, na realidade, restrito, um erro frequente e caro de corrigir depois.
#É seguro?
- Prefira .safetensors e .gguf
- São formatos que contêm apenas dados. Os arquivos antigos do PyTorch .bin e .pt dependem do mecanismo pickle do Python, que pode executar código durante o carregamento. O Hub sinaliza esses arquivos com um aviso.
- Cuidado com “trust remote code”
- Alguns repositórios, especialmente os de arquiteturas recentes ainda não integradas à biblioteca transformers, incluem código Python personalizado que o carregador pede autorização explícita para executar antes de continuar. Só conceda essa autorização a organizações que você reconhece e nas quais confia: esse código é executado com as mesmas permissões que o restante do seu programa Python, sem nenhuma restrição específica.
- Veja quem publica
- O número acumulado de downloads, a lista dos outros repositórios publicados pela mesma organização e um link para esse repositório no site oficial do laboratório são bons sinais de confiança. Contas que imitam organizações conhecidas, usando nomes semelhantes com um erro de grafia ou um sublinhado a mais, existem no Hub e em outros lugares na web: uma rápida olhada no número de downloads e no tempo de existência da conta costuma ser suficiente para identificá-las.
- O modelo permanece com você
- Após o download, um GGUF executado pelo llama.cpp ou pelo Ollama não faz mais nenhuma chamada de rede para o Hugging Face nem para qualquer outra parte, ao contrário de um modelo usado por meio de uma API hospedada na nuvem. Seus prompts e seus dados nunca saem da sua máquina, um argumento central de privacidade para quem escolhe a IA local em vez de um serviço online.
- Documentação oficial do Hub Hugging Face
- O catálogo QuelLLM: 249 modelos organizados por hardware
- Fonte: Wikipedia, histórico da empresa
- Fonte: anúncio oficial da nova CLI hf
#FAQ
Para que serve o Hugging Face?+
O Hugging Face é gratuito?+
Hugging Face é uma empresa francesa?+
É necessária uma conta para baixar um modelo?+
Qual arquivo baixar para Ollama ou LM Studio?+
Ainda é necessário usar o huggingface-cli para baixar um modelo?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.