LLMs chineses executados localmente: Qwen, DeepSeek, GLM, Kimi
Em 2026, se você baixar um LLM de pesos abertos para rodar em casa, há grandes chances de que ele venha da China. Qwen, DeepSeek, GLM, Kimi: essas famílias dominam o topo dos rankings de modelos abertos, muitas vezes com licenças mais permissivas do que as dos laboratórios ocidentais. Este panorama ajuda a distinguir as opções: o que cada família oferece, o que suas licenças realmente dizem e por que executar um LLM chinês localmente responde de antemão à questão da confidencialidade.
#Por que os LLM chineses dominam o open-weight
O cenário dos modelos abertos mudou. Há dois anos, a Meta (Llama) liderava a corrida; hoje, são os laboratórios chineses que publicam os pesos de melhor desempenho e com maior frequência. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) e Moonshot (Kimi) lançam modelos em ritmo intenso, desde os pequenos de 3B até modelos MoE com várias centenas de bilhões de parâmetros.
A razão é tanto estratégica quanto técnica: publicar os pesos em formato open-weight permite que eles ganhem visibilidade mundial, atraiam a comunidade e se estabeleçam como padrões de fato, inclusive diante dos modelos fechados americanos. Para você, que usa modelos localmente, o resultado é simples: uma enorme variedade de modelos gratuitos, atualizados regularmente e muitas vezes em pé de igualdade com a nuvem em programação, raciocínio e capacidades multilíngues.
#A execução local resolve a questão da confidencialidade
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
É a objeção automática: “um LLM chinês, meus dados vão para a China”. Isso é verdade para as APIs na nuvem (chat.qwen.ai, o app DeepSeek, a plataforma Zhipu) — nesses casos, seus prompts realmente passam por servidores remotos sujeitos à legislação chinesa. Mas este guia trata da execução local, e, nesse caso, esse receio simplesmente deixa de ter fundamento.
Quando você executa o modelo com Ollama ou LM Studio, baixa um arquivo de pesos fixo (por exemplo, um GGUF) e é a sua GPU que calcula as respostas. O modelo não tem capacidade de comunicação em rede: não é um software que “envia dados de volta ao fornecedor”, é uma grande matriz de números. Nada sai da sua máquina, independentemente da origem do modelo.
- Na nuvem (API)
- Seus prompts são enviados ao fornecedor. A origem do modelo e a jurisdição realmente importam.
- Localmente
- Os pesos rodam no seu hardware, offline se quiser. Nenhum dado sai do computador.
- O verdadeiro risco residual
- Um viés ou uma censura nas respostas do modelo (certos temas sensíveis), não um vazamento de dados. Trata-se de qualidade de saída, não de privacidade.
#As licenças reais: Apache 2.0 e MIT
Outra ideia equivocada: “as licenças chinesas são opacas ou escondem armadilhas”. A realidade de 2026 é o contrário — elas são, muitas vezes, as mais claras do mercado. A maioria dos modelos desse panorama está publicada sob Apache 2.0 ou MIT, duas licenças permissivas internacionais, inclusive para uso comercial.
- Qwen
- A maioria das variantes recentes (incluindo Qwen3.8-27B) está sob a licença Apache 2.0 — uso comercial livre, redistribuição permitida.
- DeepSeek
- Os modelos V3/V4 e R1 estão disponíveis sob licença MIT, uma das mais permissivas.
- GLM (Zhipu)
- As últimas gerações, incluindo o GLM-5.2, passaram a usar a licença MIT.
- Kimi (Moonshot)
- Pesos abertos sob licença permissiva do tipo MIT/Apache conforme as versões.
#Qwen (Alibaba): o canivete suíço
Qwen é a família mais completa e versátil do ecossistema. A Alibaba oferece o modelo em todos os tamanhos, desde o 3B, que cabe em uma GPU de entrada, até os grandes MoE, e em todas as especialidades: uso geral, código (Qwen3-Coder), visão (Qwen3-VL) e um modo “thinking” para raciocínio.
- Pontos fortes
- Excelente multilingue (incluindo um francês muito correto), faixa de tamanhos inigualável, ecossistema de ferramentas maduro, disponibilidade day-0 em Ollama.
- Tamanhos típicos
- Dos modelos de 3B/7B para testar, passando pelo 27B (Qwen3.8) como ponto ideal entre qualidade e VRAM, até os MoE 35B-A3B para GPUs de maior capacidade.
- Para quem
- A primeira opção por padrão se você está começando e quer um modelo que faça tudo corretamente.
#DeepSeek: o campeão do raciocínio
DeepSeek se tornou conhecido com o R1, um modelo de raciocínio em cadeia de pensamento que abalou o setor no início de 2025. A família continua sendo a referência para tarefas lógicas, matemáticas e de programação complexa. As versões destiladas do R1 (7B, 14B, 32B) tornam esse raciocínio acessível em hardware de uso doméstico.
- Pontos fortes
- Raciocínio e matemática de altíssimo nível, licença MIT, versões destiladas que podem ser executadas localmente.
- A armadilha
- Os principais modelos (V3/V4, 671B ou mais em MoE) são enormes: estão fora do alcance de uma única GPU. Para uso local pelo público em geral, procure os modelos destilados de R1.
- Para quem
- Quem trabalha com programação difícil, matemática ou lógica — ou quer ver o modelo “pensar” antes de responder.
#GLM (Zhipu): o outsider versátil
GLM, desenvolvido pela Zhipu AI, é o verdadeiro concorrente do Qwen. Bom em francês, sólido em código e raciocínio, oferece tamanhos razoáveis (em torno de 9B e 32B) que visam diretamente o ponto ideal dos GPUs de 12 a 24 GB, além de grandes modelos MoE como o GLM-5.2 (753B) para configurações extremas.
- Pontos fortes
- Excelente equilíbrio qualidade/tamanho nas variantes 9B-32B, bom francês, licença MIT nas últimas gerações.
- Tamanhos típicos
- 9B para uma GPU de 8 a 12 GB, 32B para 24 GB. As versões MoE de fronteira continuam reservadas a Macs com muita memória RAM unificada.
- Para quem
- Uma alternativa credível ao Qwen quando você quer comparar, ou um modelo que funciona bem em francês em hardware modesto.
#Kimi e MiniCPM: os dois extremos
Essas duas famílias ilustram as extremidades do espectro. Kimi (Moonshot) aposta em modelos muito grandes: MoEs de 1 trilhão de parâmetros e além, conhecidos por seu longo contexto e desempenho em tarefas com agentes. MiniCPM (equipe OpenBMB / ModelBest) segue o caminho oposto: modelos compactos e eficientes, projetados para rodar em dispositivos móveis ou em GPUs com pouquíssima memória.
- Kimi K2 / K3
- Modelos MoE gigantes (1T a 2,8T de parâmetros). Pesos abertos, mas “aberto” não significa “executável na sua máquina”: são necessárias dezenas de aceleradores. Reservados a servidores, não a estações de trabalho.
- MiniCPM
- Modelos ultracompactos, alguns multimodais, projetados para sistemas embarcados e configurações modestas. Ideal quando cada gigabyte de VRAM conta.
- Para lembrar
- Os modelos de pesos abertos abrangem todo o espectro de hardware. Não confunda "o modelo é livre" com "minha máquina pode executá-lo".
#Qual escolher de acordo com a VRAM
O verdadeiro fator limitante na execução local não é a marca do modelo, mas a VRAM da sua placa gráfica. Com quantização Q4_K_M (o melhor equilíbrio entre qualidade e tamanho), seguem referências concretas para classificar essas famílias por nível de hardware.
- 8 GB (RTX 3060 8G, 4060)
- Qwen 7B, GLM 9B, DeepSeek-R1 destilado de 7B em Q4 (~5 GB). Roda com conforto para chat e programação leve.
- 12 GB (RTX 3060 12G, 4070)
- O ponto ideal. Qwen 14B, GLM 9B em Q8, DeepSeek-R1 14B (~9 GB). Margem para um contexto mais amplo.
- 16 GB (RTX 4080, 5070 Ti)
- Qwen ~24-27B, DeepSeek-R1 32B com quantização agressiva. O patamar “sério” para o raciocínio.
- 24 GB (RTX 3090/4090)
- Qwen 27-32B e GLM 32B inteiramente na VRAM (~19 GB), MoE 35B-A3B. O melhor da IA local para o público em geral.
- Mac com RAM unificada (48-128+ GB)
- Único ambiente realista para grandes MoE (GLM-5.2, DeepSeek Flash) via offload para a memória unificada — com taxa de geração moderada.
#Instalar um modelo chinês na prática
A stack típica é a mesma, independentemente da origem do modelo: Ollama como daemon de inferência (escutando em http://localhost:11434), com Open WebUI ou LM Studio como interface. Veja como baixar um modelo de cada família.
- 01Instalar OllamaBaixe o daemon de ollama.com e inicie-o. Ele expõe uma API local na porta 11434 — não é preciso configurar mais nada para começar.
- 02Escolher um modelo de acordo com sua VRAMConsulte novamente a tabela acima. Em caso de dúvida, comece com Qwen 14B ou GLM 9B em Q4_K_M: eles cabem na maioria das GPUs recentes e abrangem 90% dos usos.
- 03Baixar e executarUm único comando baixa os pesos e depois abre o chat. Na primeira execução, são baixados vários gigabytes; as seguintes são instantâneas.
- 04Verificar o modo offlineDepois que os pesos estiverem em cache, desconecte a rede e continue conversando: isso comprova que o modelo está rodando 100% localmente.
#Para se aprofundar
Este panorama dá a você um mapa; estes guias detalham cada família e as configurações para uso local:
- O ponto ideal do Qwen
- « Qwen 3.8 27B localmente: instalação do Ollama, VRAM e configurações » detalha o comando exato, a VRAM por quantização e o modo thinking.
- O raciocínio DeepSeek
- “Instalar DeepSeek R1 com Ollama” abrange as versões destiladas 7B/14B/32B e a cadeia de pensamento executada localmente.
- Escolher de acordo com sua placa
- Os guias “Qual LLM para 12 GB / 16 GB / 24 GB de VRAM?” traduzem esses níveis em recomendações concretas por GPU.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.