Iniciante 12 minPanorama

LLMs chineses executados localmente: Qwen, DeepSeek, GLM, Kimi

Em 2026, se você baixar um LLM de pesos abertos para rodar em casa, há grandes chances de que ele venha da China. Qwen, DeepSeek, GLM, Kimi: essas famílias dominam o topo dos rankings de modelos abertos, muitas vezes com licenças mais permissivas do que as dos laboratórios ocidentais. Este panorama ajuda a distinguir as opções: o que cada família oferece, o que suas licenças realmente dizem e por que executar um LLM chinês localmente responde de antemão à questão da confidencialidade.

Por Mohamed Meguedmi·Atualização 2026-09-01·Testado no Windows, macOS e Linux

#Por que os LLM chineses dominam o open-weight

O cenário dos modelos abertos mudou. Há dois anos, a Meta (Llama) liderava a corrida; hoje, são os laboratórios chineses que publicam os pesos de melhor desempenho e com maior frequência. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) e Moonshot (Kimi) lançam modelos em ritmo intenso, desde os pequenos de 3B até modelos MoE com várias centenas de bilhões de parâmetros.

A razão é tanto estratégica quanto técnica: publicar os pesos em formato open-weight permite que eles ganhem visibilidade mundial, atraiam a comunidade e se estabeleçam como padrões de fato, inclusive diante dos modelos fechados americanos. Para você, que usa modelos localmente, o resultado é simples: uma enorme variedade de modelos gratuitos, atualizados regularmente e muitas vezes em pé de igualdade com a nuvem em programação, raciocínio e capacidades multilíngues.

i
Pesos abertos ≠ open-source
“Open-weight” significa que os pesos do modelo podem ser baixados e executados livremente. Isso não garante que os dados de treinamento ou o código completo sejam publicados. É o caso de quase todos os modelos deste guia — você obtém o modelo, não sua receita.

#A execução local resolve a questão da confidencialidade

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

É a objeção automática: “um LLM chinês, meus dados vão para a China”. Isso é verdade para as APIs na nuvem (chat.qwen.ai, o app DeepSeek, a plataforma Zhipu) — nesses casos, seus prompts realmente passam por servidores remotos sujeitos à legislação chinesa. Mas este guia trata da execução local, e, nesse caso, esse receio simplesmente deixa de ter fundamento.

Quando você executa o modelo com Ollama ou LM Studio, baixa um arquivo de pesos fixo (por exemplo, um GGUF) e é a sua GPU que calcula as respostas. O modelo não tem capacidade de comunicação em rede: não é um software que “envia dados de volta ao fornecedor”, é uma grande matriz de números. Nada sai da sua máquina, independentemente da origem do modelo.

Na nuvem (API)
Seus prompts são enviados ao fornecedor. A origem do modelo e a jurisdição realmente importam.
Localmente
Os pesos rodam no seu hardware, offline se quiser. Nenhum dado sai do computador.
O verdadeiro risco residual
Um viés ou uma censura nas respostas do modelo (certos temas sensíveis), não um vazamento de dados. Trata-se de qualidade de saída, não de privacidade.
→
Verificar se nada sai
Para se convencer disso: inicie o Ollama, desligue o Wi-Fi e converse com o modelo. Tudo continua funcionando. Um LLM local só precisa de acesso à rede para o download inicial dos pesos.

#As licenças reais: Apache 2.0 e MIT

Outra ideia equivocada: “as licenças chinesas são opacas ou escondem armadilhas”. A realidade de 2026 é o contrário — elas são, muitas vezes, as mais claras do mercado. A maioria dos modelos desse panorama está publicada sob Apache 2.0 ou MIT, duas licenças permissivas internacionais, inclusive para uso comercial.

Qwen
A maioria das variantes recentes (incluindo Qwen3.8-27B) está sob a licença Apache 2.0 — uso comercial livre, redistribuição permitida.
DeepSeek
Os modelos V3/V4 e R1 estão disponíveis sob licença MIT, uma das mais permissivas.
GLM (Zhipu)
As últimas gerações, incluindo o GLM-5.2, passaram a usar a licença MIT.
Kimi (Moonshot)
Pesos abertos sob licença permissiva do tipo MIT/Apache conforme as versões.
!
Mesmo assim, leia a ficha do modelo
Algumas famílias antigas ou variantes específicas podem ter uma licença própria com cláusulas de uso. Antes de uma implantação comercial, verifique sempre o arquivo LICENSE na página do Hugging Face do modelo específico que você está baixando — não apenas a reputação da família.

#Qwen (Alibaba): o canivete suíço

Qwen é a família mais completa e versátil do ecossistema. A Alibaba oferece o modelo em todos os tamanhos, desde o 3B, que cabe em uma GPU de entrada, até os grandes MoE, e em todas as especialidades: uso geral, código (Qwen3-Coder), visão (Qwen3-VL) e um modo “thinking” para raciocínio.

Pontos fortes
Excelente multilingue (incluindo um francês muito correto), faixa de tamanhos inigualável, ecossistema de ferramentas maduro, disponibilidade day-0 em Ollama.
Tamanhos típicos
Dos modelos de 3B/7B para testar, passando pelo 27B (Qwen3.8) como ponto ideal entre qualidade e VRAM, até os MoE 35B-A3B para GPUs de maior capacidade.
Para quem
A primeira opção por padrão se você está começando e quer um modelo que faça tudo corretamente.

#DeepSeek: o campeão do raciocínio

DeepSeek se tornou conhecido com o R1, um modelo de raciocínio em cadeia de pensamento que abalou o setor no início de 2025. A família continua sendo a referência para tarefas lógicas, matemáticas e de programação complexa. As versões destiladas do R1 (7B, 14B, 32B) tornam esse raciocínio acessível em hardware de uso doméstico.

Pontos fortes
Raciocínio e matemática de altíssimo nível, licença MIT, versões destiladas que podem ser executadas localmente.
A armadilha
Os principais modelos (V3/V4, 671B ou mais em MoE) são enormes: estão fora do alcance de uma única GPU. Para uso local pelo público em geral, procure os modelos destilados de R1.
Para quem
Quem trabalha com programação difícil, matemática ou lógica — ou quer ver o modelo “pensar” antes de responder.

#GLM (Zhipu): o outsider versátil

GLM, desenvolvido pela Zhipu AI, é o verdadeiro concorrente do Qwen. Bom em francês, sólido em código e raciocínio, oferece tamanhos razoáveis (em torno de 9B e 32B) que visam diretamente o ponto ideal dos GPUs de 12 a 24 GB, além de grandes modelos MoE como o GLM-5.2 (753B) para configurações extremas.

Pontos fortes
Excelente equilíbrio qualidade/tamanho nas variantes 9B-32B, bom francês, licença MIT nas últimas gerações.
Tamanhos típicos
9B para uma GPU de 8 a 12 GB, 32B para 24 GB. As versões MoE de fronteira continuam reservadas a Macs com muita memória RAM unificada.
Para quem
Uma alternativa credível ao Qwen quando você quer comparar, ou um modelo que funciona bem em francês em hardware modesto.

#Kimi e MiniCPM: os dois extremos

Essas duas famílias ilustram as extremidades do espectro. Kimi (Moonshot) aposta em modelos muito grandes: MoEs de 1 trilhão de parâmetros e além, conhecidos por seu longo contexto e desempenho em tarefas com agentes. MiniCPM (equipe OpenBMB / ModelBest) segue o caminho oposto: modelos compactos e eficientes, projetados para rodar em dispositivos móveis ou em GPUs com pouquíssima memória.

Kimi K2 / K3
Modelos MoE gigantes (1T a 2,8T de parâmetros). Pesos abertos, mas “aberto” não significa “executável na sua máquina”: são necessárias dezenas de aceleradores. Reservados a servidores, não a estações de trabalho.
MiniCPM
Modelos ultracompactos, alguns multimodais, projetados para sistemas embarcados e configurações modestas. Ideal quando cada gigabyte de VRAM conta.
Para lembrar
Os modelos de pesos abertos abrangem todo o espectro de hardware. Não confunda "o modelo é livre" com "minha máquina pode executá-lo".

#Qual escolher de acordo com a VRAM

O verdadeiro fator limitante na execução local não é a marca do modelo, mas a VRAM da sua placa gráfica. Com quantização Q4_K_M (o melhor equilíbrio entre qualidade e tamanho), seguem referências concretas para classificar essas famílias por nível de hardware.

8 GB (RTX 3060 8G, 4060)
Qwen 7B, GLM 9B, DeepSeek-R1 destilado de 7B em Q4 (~5 GB). Roda com conforto para chat e programação leve.
12 GB (RTX 3060 12G, 4070)
O ponto ideal. Qwen 14B, GLM 9B em Q8, DeepSeek-R1 14B (~9 GB). Margem para um contexto mais amplo.
16 GB (RTX 4080, 5070 Ti)
Qwen ~24-27B, DeepSeek-R1 32B com quantização agressiva. O patamar “sério” para o raciocínio.
24 GB (RTX 3090/4090)
Qwen 27-32B e GLM 32B inteiramente na VRAM (~19 GB), MoE 35B-A3B. O melhor da IA local para o público em geral.
Mac com RAM unificada (48-128+ GB)
Único ambiente realista para grandes MoE (GLM-5.2, DeepSeek Flash) via offload para a memória unificada — com taxa de geração moderada.
i
Referência de VRAM em Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Adicione sempre 1 a 2 GB para o contexto e o sistema. Um modelo que excede a capacidade da VRAM passa a usar a RAM (offload para a CPU), e sua taxa de geração despenca.

#Instalar um modelo chinês na prática

A stack típica é a mesma, independentemente da origem do modelo: Ollama como daemon de inferência (escutando em http://localhost:11434), com Open WebUI ou LM Studio como interface. Veja como baixar um modelo de cada família.

  1. 01
    Instalar Ollama
    Baixe o daemon de ollama.com e inicie-o. Ele expõe uma API local na porta 11434 — não é preciso configurar mais nada para começar.
  2. 02
    Escolher um modelo de acordo com sua VRAM
    Consulte novamente a tabela acima. Em caso de dúvida, comece com Qwen 14B ou GLM 9B em Q4_K_M: eles cabem na maioria das GPUs recentes e abrangem 90% dos usos.
  3. 03
    Baixar e executar
    Um único comando baixa os pesos e depois abre o chat. Na primeira execução, são baixados vários gigabytes; as seguintes são instantâneas.
  4. 04
    Verificar o modo offline
    Depois que os pesos estiverem em cache, desconecte a rede e continue conversando: isso comprova que o modelo está rodando 100% localmente.
Terminal
# Qwen généraliste (Alibaba, Apache 2.0)
ollama run qwen3

# DeepSeek-R1 distillé, raisonnement (MIT)
ollama run deepseek-r1:14b

# GLM, l'alternative polyvalente (Zhipu)
ollama run glm4

# Vérifier les modèles installés et que le daemon répond
curl http://localhost:11434/api/tags
→
Os nomes das tags variam
As tags exatas (qwen3, deepseek-r1:14b, etc.) e as versões disponíveis evoluem rapidamente na biblioteca Ollama. Consulte ollama.com/library para verificar o nome exato e o tamanho em GB de cada variante antes de baixar.

#Para se aprofundar

Este panorama dá a você um mapa; estes guias detalham cada família e as configurações para uso local:

O ponto ideal do Qwen
« Qwen 3.8 27B localmente: instalação do Ollama, VRAM e configurações » detalha o comando exato, a VRAM por quantização e o modo thinking.
O raciocínio DeepSeek
“Instalar DeepSeek R1 com Ollama” abrange as versões destiladas 7B/14B/32B e a cadeia de pensamento executada localmente.
Escolher de acordo com sua placa
Os guias “Qual LLM para 12 GB / 16 GB / 24 GB de VRAM?” traduzem esses níveis em recomendações concretas por GPU.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.