Copilot gratuito local: Cline, Tabby & CodeGeeX no VS Code (2026)
GitHub Copilot custa 10 €/mês e envia cada caractere que você digita para um servidor da Microsoft. Três extensões gratuitas do VS Code resolvem os dois problemas conectando o chat e o preenchimento automático a um LLM local: Cline, Tabby e CodeGeeX. Este guia instala as três, mostra quais modelos usar e compara o que elas realmente fazem para ajudá-lo a escolher um copiloto gratuito local para o VS Code.
#Por que um Copilot local gratuito para o VS Code?
Copilot e Cursor enviam seu código para a OpenAI ou a Anthropic. Em um projeto de cliente sob NDA, com código proprietário ou simplesmente por princípio, isso nem sempre é aceitável. Um copilot local resolve três coisas de uma vez: zero vazamento (nada sai do laptop), zero assinatura, zero latência de rede.
Há uma contrapartida, que é preciso reconhecer: a qualidade de um Qwen 3.5 9B executado localmente não se iguala à do modelo mais recente do Copilot Pro. Mas para usos cotidianos — completar um laço, escrever um teste, refatorar uma função de 30 linhas — um modelo de 9 a 24B em Q4 faz o trabalho. E para tarefas que o modelo local não consegue realizar, você mantém o Copilot em paralelo.
#Pré-requisitos
Este guia leva você ao modelo. O kit leva você ao copiloto que programa no seu editor.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- VS Code recente
- Versão 1.85+ para a API de autocompletar inline. Também existem extensões para JetBrains para as três ferramentas.
- Ollama instalado
- Serve como backend de inferência para o Cline. Escuta por padrão em http://localhost:11434. Para o Tabby, o runtime está incluído; o CodeGeeX pode apontar para o Ollama.
- GPU com no mínimo 8 GB de VRAM
- RTX 3060 12 GB, 4060 Ti 16 GB, Mac M2/M3 com 16 GB de memória unificada. Abaixo dessas configurações, continue com modelos de 1,5B (qwen2.5-coder:1.5b) para completar código, que continuam respondendo rapidamente.
- 20 GB de espaço em disco
- Um modelo de código de 7B em Q4 = 4 a 5 GB. Reserve uma boa margem se estiver testando vários modelos ou várias ferramentas.
#1. Cline (chat + agente)
O Cline é a opção mais completa em termos de assistência: chat lateral e modo agente capaz de ler e modificar vários arquivos, como o Cursor, tudo executado localmente via Ollama. De código aberto sob licença MIT e com BYO-LLM, é o substituto natural do Continue.dev. O Roo Code, um fork do Cline, também está encerrando suas atividades: o Cline se torna, portanto, o ponto de consolidação desse ecossistema. Sua limitação: não oferece complementação de código inline — isso é abordado com o Tabby mais abaixo.
- 01Instalar a extensãoNo VS Code, abra a paleta de extensões (Ctrl+Shift+X), procure Cline e instale a extensão. Um ícone do Cline aparece na barra lateral esquerda.
- 02Baixar um modeloQwen 3.5 9B faz um bom trabalho de chat e de agente com 8 GB de VRAM. Aumente para Devstral 24B ou Qwen 3.6 35B-A3B se tiver margem; o Devstral foi especialmente projetado para agentes.
- 03Configurar o provedor OllamaAbra as configurações de Cline, escolha o provedor Ollama, insira a URL local e selecione o modelo.
- 04Testar o chatFaça uma pergunta, cole código, peça uma correção. A resposta aparece no painel, sem enviar nada para a nuvem.
- 05Testar o agenteDescreva uma tarefa que envolva vários arquivos. O Cline propõe um plano e depois aplica as alterações na forma de diffs que você valida um a um.
#2. Tabby (autocompletar auto-hospedado)
O Tabby (TabbyML) cobre exatamente o que o Cline não faz: o preenchimento automático em linha. Ele foi projetado para equipes — um único servidor hospeda o modelo, e todos os desenvolvedores se conectam a ele a partir de seus IDEs. O servidor inclui seu próprio runtime e não precisa do Ollama.
- 01Iniciar o servidor TabbyO Docker é a maneira mais simples. O servidor expõe um endpoint HTTP na porta :8080 e uma interface de administração web.
- 02Criar uma conta adminAbra http://localhost:8080 no navegador. No primeiro acesso, crie a conta do proprietário. Acesse Settings → Information para obter um token de autenticação.
- 03Instalar a extensão para o VS CodeNo painel de extensões, procure Tabby (publicador: TabbyML). Instale.
- 04Conectar a extensãoAbra as configurações (Ctrl+,), procure por tabby. Coloque Endpoint = http://localhost:8080 e cole o token. A barra de status do VS Code exibe Tabby: ready; a sugestão aparece em cinza enquanto você digita.
#3. CodeGeeX
CodeGeeX (Tsinghua KEG / Zhipu AI) é a opção “tudo em um”: a extensão já inclui autocompletação e chat com um modelo proprietário gratuito hospedado por eles. Mas ela também pode se conectar a um modelo local, que é o que nos interessa aqui.
- 01Instalar a extensãoNo VS Code, procure por CodeGeeX (publicador: aminer). Instale. Um ícone do CodeGeeX aparece na barra lateral.
- 02Alternar para modo localAbra as configurações do CodeGeeX (engrenagem no painel lateral). Procure a seção Local mode e ative-a.
- 03Apontar para OllamaInforme a URL do modelo local. O CodeGeeX fala com um endpoint compatível com OpenAI — o endpoint de Ollama em http://localhost:11434/v1 é adequado.
- 04Escolher o modelocodegeex4 (9B) é o modelo próprio disponível no Ollama. Como alternativa, qualquer modelo recente de programação serve (qwen3-coder, devstral).
#Tabela comparativa
| Ferramenta | O que ele faz | Backend local | Licença | Ideal para |
|---|---|---|---|---|
| Cline | Chat + agente que trabalha com vários arquivos | Ollama (1 por estação de trabalho) | MIT, de código aberto | Uso individual, usuário avançado |
| Tabby | Autocompletação inline | Runtime incluído (servidor) | Self-hosted | Equipe, complemento de Cline |
| CodeGeeX | Autocompletar + chat | Endpoint compatível com a OpenAI | Gratuito (usa a nuvem por padrão) | Configuração leve, tudo em um |
- Cobertura dos usos
- Cline: chat + agente (sem autocompletar código). Tabby: autocompletar código (sem chat avançado). CodeGeeX: autocompletar código + chat básico. O combo Cline + Tabby cobre tudo.
- Esforço de configuração
- CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby self-hosted (15-20 min).
- Multi-utilisateurs
- Apenas o Tabby foi projetado para isso nativamente. Cline/CodeGeeX = uma estação de trabalho = um Ollama.
- Privacidade
- Cline e Tabby permanecem locais por padrão. CodeGeeX usa a nuvem enquanto o modo local não tiver sido ativado — fique de olho nisso.
#Solução de problemas
- Cline não responde
- Verifique o ollama ps: o modelo deve aparecer quando você realizar uma requisição. Se Ollama não responder, teste o curl http://localhost:11434/api/tags no terminal. Verifique também que o provedor selecionado em Cline seja realmente Ollama.
- Sem sugestões de autocompletar em cinza
- O Cline não oferece preenchimento automático em linha: isso é normal. Instale o Tabby (ou Twinny) para o preenchimento automático linha a linha e verifique editor.inlineSuggest.enabled no VS Code.
- Tabby exibe "Connection refused"
- O contêiner não está rodando ou a porta não está exposta. O comando docker ps deve listar tabby. O comando docker logs tabby mostra a causa (geralmente: modelo não baixado na primeira execução, aguarde 5 a 10 minutos).
- CodeGeeX retorna respostas em chinês
- Especifique o idioma no prompt de sistema (Settings CodeGeeX → Custom system prompt → "Sempre responder em francês"), ou use o Qwen 3.5 9B, que responde em francês quando você fala com ele em francês.
- VRAM saturada quando tudo está em execução
- Você talvez tenha dois modelos carregados (autocompletar do Tabby + chat do Cline). Com 8 GB, mantenha um modelo FIM leve para o autocompletar e um Qwen 3.5 9B para o chat. ollama ps mostra o consumo.
#FAQ
Qual é a melhor alternativa gratuita ao Copilot que roda localmente?+
Por que este guia não fala mais de Continue.dev?+
O Cline oferece preenchimento automático como o Copilot?+
Qual modelo local escolher para programar?+
É preciso ter uma GPU potente para isso?+
#Para se aprofundar
Você tem um copiloto local rodando. Três direções lógicas de acordo com seu perfil:
- Aprofundar o conhecimento sobre o Cline
- O guia dedicado ao Copilot local com Cline aprofunda a configuração: provedor Ollama, modo agente, autocompletar via Tabby/Twinny e ajustes finos para o uso de agentes.
- Você vinha do Continue.dev
- Guia de migração Continue → Cline detalha a transição (configurações equivalentes, modelos, dados locais).
- Escolher seu hardware
- Antes de passar para um modelo de 14B ou 32B, o guia Escolher seu GPU para IA local ajuda você a evitar a compra de um GPU com VRAM insuficiente.
Se você quiser economizar tempo com os ajustes, o guia pago “Copiloto de código local” fornece um pacote completo de configurações Ollama + Cline + Aider prontas para usar e colar, tanto para uma estação de trabalho individual quanto para uma equipe.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.