Iniciante 11 minConceitos

Hugging Face: o que é e como usá-lo ?

Resposta direta

O Hugging Face é a plataforma onde quase todos os modelos de IA abertos são publicados: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. A plataforma costuma ser descrita como o GitHub do machine learning: o repositório de onde vêm os arquivos, incluindo os que Ollama e LM Studio baixam para você. O Hub ultrapassou três milhões de modelos públicos em 18 de agosto de 2026, sem nenhuma seleção editorial.

O Hugging Face é a plataforma onde quase todos os modelos de IA abertos são publicados: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. Costuma-se dizer que é o GitHub do machine learning. Para quem roda uma IA em sua própria máquina, é o repositório de onde vêm todos os arquivos, incluindo os que Ollama e LM Studio baixam para você. O Hub ultrapassou oficialmente três milhões de modelos públicos em 18 de agosto de 2026, a um ritmo de cerca de 2.700 a 3.000 novos modelos por dia, sem nenhum filtro. Esta página ensina a interpretá-lo: qual repositório abrir, qual arquivo pegar para a sua placa de vídeo e o que verificar antes de clicar.

Por Mohamed Meguedmi·Atualização 2026-09-28·Testado no Windows, macOS e Linux

#O que é o Hugging Face?

Hugging Face é uma empresa fundada em 2016 por três empreendedores franceses, Clément Delangue, Julien Chaumond e Thomas Wolf, com operações em Nova York e Paris e sede nos Estados Unidos. Começou com um aplicativo de chatbot voltado para adolescentes, um projeto hoje abandonado, daí o nome inspirado no emoji que sorri com as mãos abertas. Em seguida, voltou-se para ferramentas open source para aprendizado de máquina: sua biblioteca transformers tornou-se a forma quase padrão de carregar e executar um modelo de linguagem em Python, adotada pela maioria dos laboratórios de pesquisa e das empresas do setor. Por fim, a empresa construiu o Hub, uma plataforma de hospedagem baseada no sistema de controle de versões Git, onde qualquer pessoa pode publicar gratuitamente modelos, conjuntos de dados e pequenas demonstrações web, sem validação editorial prévia.

Para a IA local, o Hub funciona como uma loja de aplicativos, com duas diferenças: quase tudo é gratuito e nada é selecionado para você. Diferentemente de uma loja de aplicativos tradicional, ninguém testa, aprova nem classifica os modelos antes da publicação: qualquer pessoa pode criar uma conta gratuita e disponibilizar um repositório em poucos minutos, sem validação nem controle de qualidade de qualquer tipo. Essa ausência total de filtro é, ao mesmo tempo, a força do Hub — tudo chega lá primeiro, muitas vezes antes mesmo do anúncio oficial de um laboratório — e sua principal armadilha para um iniciante, que pode se deparar com centenas de resultados de pesquisa sem saber qual é confiável. Saber se orientar, distinguir um repositório oficial de uma cópia de terceiros e uma conversão séria de uma tentativa abandonada é a habilidade a adquirir antes de baixar qualquer coisa.

#As três seções do Hub

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
SeçãoConteúdoInteresse pela IA local
ModelsArquivos de pesos, configuração, documentaçãoÉ aqui que está o arquivo que você vai rodar
DatasetsDados de treinamento e avaliaçãoApenas se você estiver fazendo fine-tuning ou testes
SpacesPequenas aplicações web, geralmente demonstraçõesExperimentar um modelo no navegador antes de baixar 15 GB

#Ler uma página do modelo

Cada modelo tem um endereço na forma huggingface.co/organisation/nom-du-modele, por exemplo huggingface.co/Qwen/Qwen3-8B. Quatro elementos distintos dessa página merecem sua atenção antes de qualquer download.

Nome da organização
Qwen, google, meta-llama, mistralai, openai, deepseek-ai são os próprios laboratórios, verificados. Qualquer outro nome indica um terceiro: às vezes excelente, mas nunca o original do laboratório.
A ficha do modelo (model card)
O arquivo README: o que é o modelo, como foi treinado, seus usos previstos, suas pontuações, seu formato de prompt e suas limitações. A qualidade varia: pode ser muito completo ou estar vazio.
A licença
Exibida em destaque no topo da página, ao lado do nome do modelo. Consultar a seção específica abaixo para saber o que cada licença comum realmente permite.
A aba Files and versions
A lista completa de arquivos disponíveis para download. Uma olhada rápida basta para saber imediatamente em que tipo de repositório você está.

#Qual repositório escolher: pesos originais ou GGUF

O que você vê no FilesO que éPara quais ferramentasTamanho para um modelo 8B
model-00001-of-00004.safetensors…Pesos originais, em BF16, divididos em vários arquivostransformers, vLLM, ferramentas de fine-tuning≈ 16 GB
…-Q4_K_M.gguf, …-Q8_0.ggufConversões quantizadas, um único arquivo por nívelOllama, LM Studio, llama.cpp, KoboldCpp, Jan≈ 5 GB em Q4
Repositórios …-AWQ, …-GPTQ, …-FP8Quantização pensada para servidores GPUvLLM e motores equivalentes≈ 5 a 9 GB
Repositórios …-MLX-4bitFormato Apple SiliconMLX, LM Studio no Mac≈ 5 GB

Os laboratórios publicam principalmente o primeiro tipo, os pesos originais como saem do treinamento. Os arquivos GGUF necessários para aplicativos de desktop são produzidos separadamente por conversores: alguns laboratórios publicam os seus diretamente, e contribuidores comunitários como bartowski, unsloth ou a organização ggml-org cobrem quase todo o restante, geralmente apenas algumas horas após um lançamento muito aguardado. Para encontrá-los sem procurar ao acaso, abra a página do modelo original e siga o link Quantizations na árvore do modelo, exibida à direita da página, ou busque simplesmente o nome do modelo seguido do termo GGUF na barra de pesquisa do Hub, que geralmente coloca as conversões mais baixadas no topo da lista.

#Escolher o arquivo correto para sua placa

Um repositório GGUF geralmente oferece cerca de uma dezena de arquivos para o mesmo modelo, um por nível de quantização disponível, do mais comprimido ao mais fiel. O tamanho do arquivo corresponde, aproximadamente, à VRAM que os pesos ocuparão quando o modelo for carregado na memória. Mantenha sempre de 1 a 3 GB de VRAM livres para o contexto da conversa e para a margem de funcionamento do sistema.

Calculado a partir do catálogo QuelLLM · 20/09/2026 · tamanhos arredondados para o próximo GB
ModeloQ4_K_MQ5_K_MQ8_0BF16Placa de vídeo com folga para Q4
Qwen 3 8B5 GB6 GB9 GB16 GB8 GB
Gemma 4 12B7 GB9 GB13 GB24 GB12 GB
Qwen 3 14B9 GB11 GB16 GB28 GB12 GB
gpt-oss 20B13 GB16 GB23 GB42 GB16 GB
Mistral Small 3.2 24B14 GB17 GB26 GB48 GB16 GB
Qwen 3.8 27B16 GB19 GB29 GB54 GB24 GB
Llama 3.3 70B40 GB48 GB75 GB140 GB2 × 24 GB

#Três formas de baixar

A mais simples é deixar sua ferramenta cuidar disso. A busca do LM Studio consulta diretamente o Hugging Face e indica quais arquivos cabem na sua máquina. Tanto Ollama quanto llama.cpp conseguem baixar um repositório GGUF pelo nome.

Pelo Ollama ou llama.cpp
# Ollama : lancer n'importe quel dépôt GGUF du Hub
ollama run hf.co/bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M

# llama.cpp : télécharger et servir
llama-server -hf bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M
Com o utilitário de linha de comando
pip install -U huggingface_hub
hf download bartowski/Qwen_Qwen3-8B-GGUF --include "*Q4_K_M.gguf" --local-dir ./models

O filtro --include é importante: sem ele, você baixa todas as quantizações do repositório, muitas vezes mais de 100 GB. Terceira opção, o navegador: aba Files and versions, seta de download ao lado do arquivo. Prático para um GGUF isolado, inadequado para os pesos originais divididos em vários arquivos.

i
Um tutorial antigo fala sobre o huggingface-cli?
Ignore-o: o comando huggingface-cli download foi descontinuado e simplesmente removido desde a versão 1.0 da biblioteca huggingface_hub, sendo substituído pelo comando mais curto hf, apresentado pela própria Hugging Face como "uma CLI mais rápida e mais amigável". A substituição é mecânica: use hf download em todos os lugares em que o antigo tutorial usava huggingface-cli download, com as mesmas opções.
i
Modelos com acesso condicional
Alguns laboratórios, entre eles a Meta para a família Llama, exigem que você aceite suas condições antes do download. Crie uma conta gratuita, clique no botão de acesso da página do modelo e depois autentique a ferramenta de linha de comando uma vez com hf auth login e um token criado nas configurações da conta. As conversões GGUF comunitárias geralmente não têm acesso restrito, mas a licença original continua se aplicando a você.

#Licenças: aberto não significa sem condições

Licenças listadas no catálogo QuelLLM · 20/09/2026
LicençaExemplos do catálogoUso comercial
Apache 2.0Família Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2Sim, com menção
MITDestilações DeepSeek R1, GLM 4.7 FlashSim
Licença Llama CommunityLlama 3.3 70BSim, com condições: regras de nomenclatura, política de uso, limite de usuários
Não comercial, pesquisaVárias publicações de pesquisaNão

A indicação exibida na ficha do modelo prevalece em caso de dúvida, e um modelo derivado, ajustado por fine-tuning ou resultante da fusão com outro geralmente herda as obrigações do seu modelo de base, mesmo quando o README do derivado não menciona isso explicitamente. Para uma implantação em uma empresa ou em um produto comercial, esses dois minutos de leitura atenta da licença evitam construir toda uma integração com um modelo cujo uso comercial é, na realidade, restrito, um erro frequente e caro de corrigir depois.

#É seguro?

Prefira .safetensors e .gguf
São formatos que contêm apenas dados. Os arquivos antigos do PyTorch .bin e .pt dependem do mecanismo pickle do Python, que pode executar código durante o carregamento. O Hub sinaliza esses arquivos com um aviso.
Cuidado com “trust remote code”
Alguns repositórios, especialmente os de arquiteturas recentes ainda não integradas à biblioteca transformers, incluem código Python personalizado que o carregador pede autorização explícita para executar antes de continuar. Só conceda essa autorização a organizações que você reconhece e nas quais confia: esse código é executado com as mesmas permissões que o restante do seu programa Python, sem nenhuma restrição específica.
Veja quem publica
O número acumulado de downloads, a lista dos outros repositórios publicados pela mesma organização e um link para esse repositório no site oficial do laboratório são bons sinais de confiança. Contas que imitam organizações conhecidas, usando nomes semelhantes com um erro de grafia ou um sublinhado a mais, existem no Hub e em outros lugares na web: uma rápida olhada no número de downloads e no tempo de existência da conta costuma ser suficiente para identificá-las.
O modelo permanece com você
Após o download, um GGUF executado pelo llama.cpp ou pelo Ollama não faz mais nenhuma chamada de rede para o Hugging Face nem para qualquer outra parte, ao contrário de um modelo usado por meio de uma API hospedada na nuvem. Seus prompts e seus dados nunca saem da sua máquina, um argumento central de privacidade para quem escolhe a IA local em vez de um serviço online.

#FAQ

Para que serve o Hugging Face?+
Para publicar e baixar modelos de IA abertos, conjuntos de dados e pequenas demonstrações web. Para IA local, é a principal fonte de arquivos de modelos, especialmente versões GGUF quantizadas que Ollama, LM Studio e llama.cpp carregam diretamente, muitas vezes produzidas por colaboradores da comunidade algumas horas após o lançamento oficial de um modelo pelo laboratório que o desenvolveu.
O Hugging Face é gratuito?+
Consultar e baixar os modelos públicos é totalmente gratuito e não exige uma conta, exceto para modelos com acesso condicional, para os quais a conta também é gratuita. Na prática, a empresa cobra pela inferência hospedada em seus servidores, pela capacidade de processamento adicional para os Spaces, pelo armazenamento de repositórios privados e por suas ofertas destinadas às empresas.
Hugging Face é uma empresa francesa?+
Foi fundada em 2016 por três empreendedores franceses, Clément Delangue, Julien Chaumond e Thomas Wolf, e mantém uma equipe importante em Paris, mas sua sede fica em Nova York, nos Estados Unidos. É uma das poucas plataformas realmente importantes da IA mundial com raízes francesas tão marcantes.
É necessária uma conta para baixar um modelo?+
Não na grande maioria dos casos: a consulta e o download de modelos públicos não exigem nada. Uma conta gratuita e um token de acesso só se tornam necessários para modelos cujo laboratório exige a aceitação prévia de suas condições de uso, como a família Llama da Meta ou alguns lançamentos do Google.
Qual arquivo baixar para Ollama ou LM Studio?+
Um único arquivo .gguf proveniente de um repositório GGUF, geralmente a variante Q4_K_M para começar, cujo tamanho seja de 1 a 3 GB menor que a capacidade de memória da sua placa gráfica. Os arquivos .safetensors divididos em partes do repositório original do laboratório são destinados a frameworks Python como transformers e a motores de servidor como vLLM, não a aplicativos de desktop.
Ainda é necessário usar o huggingface-cli para baixar um modelo?+
Não: esse comando foi descontinuado e removido na versão 1.0 do huggingface_hub. O comando atual, apresentado pelo Hugging Face como mais rápido e mais simples, chama-se hf: hf download seguido do nome do repositório funciona exatamente onde um tutorial antigo usava huggingface-cli download, com as mesmas opções de filtragem.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.