Intermediário 15 minIDE

Copilot gratuito local: Cline, Tabby & CodeGeeX no VS Code (2026)

GitHub Copilot custa 10 €/mês e envia cada caractere que você digita para um servidor da Microsoft. Três extensões gratuitas do VS Code resolvem os dois problemas conectando o chat e o preenchimento automático a um LLM local: Cline, Tabby e CodeGeeX. Este guia instala as três, mostra quais modelos usar e compara o que elas realmente fazem para ajudá-lo a escolher um copiloto gratuito local para o VS Code.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
i
Continue não é mais mantido (junho de 2026)
Continue foi adquirido pelo Cursor (Anysphere) em 18 de junho de 2026: o repositório está arquivado (v2.0.0 é a última versão) e a extensão não é mais mantida — ainda pode ser instalada por meio de forks da comunidade, e este guia continua funcionando como está. Para uma nova configuração, recomendamos preferencialmente o Cline (de código aberto, MIT, compatível com Ollama): veja nosso guia “Migrar de Continue para Cline”.

#Por que um Copilot local gratuito para o VS Code?

Copilot e Cursor enviam seu código para a OpenAI ou a Anthropic. Em um projeto de cliente sob NDA, com código proprietário ou simplesmente por princípio, isso nem sempre é aceitável. Um copilot local resolve três coisas de uma vez: zero vazamento (nada sai do laptop), zero assinatura, zero latência de rede.

Há uma contrapartida, que é preciso reconhecer: a qualidade de um Qwen 3.5 9B executado localmente não se iguala à do modelo mais recente do Copilot Pro. Mas para usos cotidianos — completar um laço, escrever um teste, refatorar uma função de 30 linhas — um modelo de 9 a 24B em Q4 faz o trabalho. E para tarefas que o modelo local não consegue realizar, você mantém o Copilot em paralelo.

i
O que essas 3 ferramentas fazem
Cline = chat + agente que trabalha em vários arquivos (sem autocompletar inline). Tabby = apenas autocompletar, com foco em hospedagem própria para equipes. CodeGeeX = autocompletar + chat, com modelo próprio integrado. Todos funcionam no VS Code e no JetBrains.
→
E Continue.dev?
O Continue.dev aparecia nas seleções de ferramentas até 2026, mas foi adquirido pela Cursor (aquisição anunciada em 18 de junho de 2026). A v2.0.0 é a última versão estável publicada, e o futuro da extensão independente é incerto. Nós o substituímos pelo Cline, seu equivalente de código aberto que continua ativo. Se você ainda o utilizava, saiba que o prazo para exportar os dados hospedados terminou em 15 de julho de 2026.

#Pré-requisitos

O kit Copiloto Local

Este guia leva você ao modelo. O kit leva você ao copiloto que programa no seu editor.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
VS Code recente
Versão 1.85+ para a API de autocompletar inline. Também existem extensões para JetBrains para as três ferramentas.
Ollama instalado
Serve como backend de inferência para o Cline. Escuta por padrão em http://localhost:11434. Para o Tabby, o runtime está incluído; o CodeGeeX pode apontar para o Ollama.
GPU com no mínimo 8 GB de VRAM
RTX 3060 12 GB, 4060 Ti 16 GB, Mac M2/M3 com 16 GB de memória unificada. Abaixo dessas configurações, continue com modelos de 1,5B (qwen2.5-coder:1.5b) para completar código, que continuam respondendo rapidamente.
20 GB de espaço em disco
Um modelo de código de 7B em Q4 = 4 a 5 GB. Reserve uma boa margem se estiver testando vários modelos ou várias ferramentas.
→
VRAM real por tamanho do modelo de código
Qwen 3.5 9B Q4 ≈ 6,6 GB · Gemma 4 12B ≈ 7,6 GB · Devstral 24B Q4 ≈ 14 GB · Qwen 3.6 35B-A3B ≈ 23 GB. Para o preenchimento de código inline (FIM), a latência tem prioridade sobre a qualidade: um modelo FIM pequeno como Qwen2.5-Coder é suficiente. Mantenha um Qwen 3.5 9B para o chat e um Devstral 24B para o agente se você tiver VRAM suficiente.

#1. Cline (chat + agente)

O Cline é a opção mais completa em termos de assistência: chat lateral e modo agente capaz de ler e modificar vários arquivos, como o Cursor, tudo executado localmente via Ollama. De código aberto sob licença MIT e com BYO-LLM, é o substituto natural do Continue.dev. O Roo Code, um fork do Cline, também está encerrando suas atividades: o Cline se torna, portanto, o ponto de consolidação desse ecossistema. Sua limitação: não oferece complementação de código inline — isso é abordado com o Tabby mais abaixo.

  1. 01
    Instalar a extensão
    No VS Code, abra a paleta de extensões (Ctrl+Shift+X), procure Cline e instale a extensão. Um ícone do Cline aparece na barra lateral esquerda.
  2. 02
    Baixar um modelo
    Qwen 3.5 9B faz um bom trabalho de chat e de agente com 8 GB de VRAM. Aumente para Devstral 24B ou Qwen 3.6 35B-A3B se tiver margem; o Devstral foi especialmente projetado para agentes.
  3. 03
    Configurar o provedor Ollama
    Abra as configurações de Cline, escolha o provedor Ollama, insira a URL local e selecione o modelo.
  4. 04
    Testar o chat
    Faça uma pergunta, cole código, peça uma correção. A resposta aparece no painel, sem enviar nada para a nuvem.
  5. 05
    Testar o agente
    Descreva uma tarefa que envolva vários arquivos. O Cline propõe um plano e depois aplica as alterações na forma de diffs que você valida um a um.
Baixar o modelo
ollama pull qwen3.5:9b
# Plus de VRAM ? Devstral, spécialiste agent de code, suit mieux le mode agent
ollama pull devstral:24b
Configurações do provedor no Cline
Provider : Ollama
Base URL : http://localhost:11434
Modèle   : qwen3.5:9b
→
Variante instruct para o agente
Para o chat e o agente de Cline, use a variante instruct/chat do modelo (não a variante -base, reservada para autocompletar). Ela segue melhor instruções em múltiplos passos.

#2. Tabby (autocompletar auto-hospedado)

O Tabby (TabbyML) cobre exatamente o que o Cline não faz: o preenchimento automático em linha. Ele foi projetado para equipes — um único servidor hospeda o modelo, e todos os desenvolvedores se conectam a ele a partir de seus IDEs. O servidor inclui seu próprio runtime e não precisa do Ollama.

  1. 01
    Iniciar o servidor Tabby
    O Docker é a maneira mais simples. O servidor expõe um endpoint HTTP na porta :8080 e uma interface de administração web.
  2. 02
    Criar uma conta admin
    Abra http://localhost:8080 no navegador. No primeiro acesso, crie a conta do proprietário. Acesse Settings → Information para obter um token de autenticação.
  3. 03
    Instalar a extensão para o VS Code
    No painel de extensões, procure Tabby (publicador: TabbyML). Instale.
  4. 04
    Conectar a extensão
    Abra as configurações (Ctrl+,), procure por tabby. Coloque Endpoint = http://localhost:8080 e cole o token. A barra de status do VS Code exibe Tabby: ready; a sugestão aparece em cinza enquanto você digita.
Início do Tabby (GPU NVIDIA)
docker run -d --name tabby \
  --gpus all -p 8080:8080 \
  -v $HOME/.tabby:/data \
  registry.tabbyml.com/tabbyml/tabby \
  serve --model StarCoder-1B --device cuda
i
Cline + Tabby: o duo completo
Cline gerencia o chat e o agente, enquanto Tabby gerencia o preenchimento automático em linha. Juntos, eles reproduzem a experiência completa do Copilot — localmente e de graça. É a combinação recomendada tanto para um computador de uso individual quanto para uma equipe. Twinny é uma alternativa ao Tabby se você preferir continuar usando o Ollama também para o preenchimento automático.

#3. CodeGeeX

CodeGeeX (Tsinghua KEG / Zhipu AI) é a opção “tudo em um”: a extensão já inclui autocompletação e chat com um modelo proprietário gratuito hospedado por eles. Mas ela também pode se conectar a um modelo local, que é o que nos interessa aqui.

  1. 01
    Instalar a extensão
    No VS Code, procure por CodeGeeX (publicador: aminer). Instale. Um ícone do CodeGeeX aparece na barra lateral.
  2. 02
    Alternar para modo local
    Abra as configurações do CodeGeeX (engrenagem no painel lateral). Procure a seção Local mode e ative-a.
  3. 03
    Apontar para Ollama
    Informe a URL do modelo local. O CodeGeeX fala com um endpoint compatível com OpenAI — o endpoint de Ollama em http://localhost:11434/v1 é adequado.
  4. 04
    Escolher o modelo
    codegeex4 (9B) é o modelo próprio disponível no Ollama. Como alternativa, qualquer modelo recente de programação serve (qwen3-coder, devstral).
Modelo CodeGeeX em Ollama
ollama pull codegeex4
!
Modo de nuvem por padrão
Por padrão, o CodeGeeX utiliza os servidores Zhipu na China. Enquanto você não mudar explicitamente para o modo local nas configurações, seu código será enviado para esses servidores. Verifique o indicador na barra de status do VS Code: deve aparecer 'Local', não 'Cloud'.

#Tabela comparativa

As 3 alternativas gratuitas locais ao Copilot no VS Code
FerramentaO que ele fazBackend localLicençaIdeal para
ClineChat + agente que trabalha com vários arquivosOllama (1 por estação de trabalho)MIT, de código abertoUso individual, usuário avançado
TabbyAutocompletação inlineRuntime incluído (servidor)Self-hostedEquipe, complemento de Cline
CodeGeeXAutocompletar + chatEndpoint compatível com a OpenAIGratuito (usa a nuvem por padrão)Configuração leve, tudo em um
Cobertura dos usos
Cline: chat + agente (sem autocompletar código). Tabby: autocompletar código (sem chat avançado). CodeGeeX: autocompletar código + chat básico. O combo Cline + Tabby cobre tudo.
Esforço de configuração
CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby self-hosted (15-20 min).
Multi-utilisateurs
Apenas o Tabby foi projetado para isso nativamente. Cline/CodeGeeX = uma estação de trabalho = um Ollama.
Privacidade
Cline e Tabby permanecem locais por padrão. CodeGeeX usa a nuvem enquanto o modo local não tiver sido ativado — fique de olho nisso.
→
Recomendação prática
Para começar sozinho: Cline + Qwen 3.5 9B no Ollama para o chat e o agente, mais Tabby para a autocompleção. Para uma equipe de 3 ou mais desenvolvedores que compartilham uma GPU: Tabby para a autocompleção compartilhada, Cline na estação de trabalho. CodeGeeX continua sendo uma alternativa leve e tudo em um.

#Solução de problemas

Cline não responde
Verifique o ollama ps: o modelo deve aparecer quando você realizar uma requisição. Se Ollama não responder, teste o curl http://localhost:11434/api/tags no terminal. Verifique também que o provedor selecionado em Cline seja realmente Ollama.
Sem sugestões de autocompletar em cinza
O Cline não oferece preenchimento automático em linha: isso é normal. Instale o Tabby (ou Twinny) para o preenchimento automático linha a linha e verifique editor.inlineSuggest.enabled no VS Code.
Tabby exibe "Connection refused"
O contêiner não está rodando ou a porta não está exposta. O comando docker ps deve listar tabby. O comando docker logs tabby mostra a causa (geralmente: modelo não baixado na primeira execução, aguarde 5 a 10 minutos).
CodeGeeX retorna respostas em chinês
Especifique o idioma no prompt de sistema (Settings CodeGeeX → Custom system prompt → "Sempre responder em francês"), ou use o Qwen 3.5 9B, que responde em francês quando você fala com ele em francês.
VRAM saturada quando tudo está em execução
Você talvez tenha dois modelos carregados (autocompletar do Tabby + chat do Cline). Com 8 GB, mantenha um modelo FIM leve para o autocompletar e um Qwen 3.5 9B para o chat. ollama ps mostra o consumo.

#FAQ

Qual é a melhor alternativa gratuita ao Copilot que roda localmente?+
Não há uma única resposta, pois as ferramentas não atendem à mesma necessidade. Para o chat e o agente que trabalha com vários arquivos, o Cline é o mais completo. Para o autocompletar inline, Tabby (ou Twinny). Na prática, a dupla Cline + Tabby reproduz a experiência completa do Copilot, gratuitamente e localmente. O CodeGeeX é a opção tudo em um mais rápida de instalar.
Por que este guia não fala mais de Continue.dev?+
O Continue.dev foi adquirido pelo Cursor (acqui-hire anunciado em 18 de junho de 2026). A versão 2.0.0 é a última versão estável publicada e o futuro da extensão autônoma é incerto. O código continua sob a licença Apache 2.0, então as builds fixadas continuam funcionando, mas, para uma base de código mantida ativamente, é melhor migrar para Cline. O prazo para exportar os dados hospedados era 15 de julho de 2026 (já encerrado).
O Cline oferece preenchimento automático como o Copilot?+
Não. O Cline se concentra no chat e no modo agente (ler e modificar vários arquivos). Ele não oferece autocompletar linha por linha com sugestões em cinza. Para essa função, adicione Tabby ou Twinny em paralelo — as duas extensões coexistem sem conflito no VS Code.
Qual modelo local escolher para programar?+
Para o preenchimento automático inline (FIM), Qwen2.5-Coder continua sendo uma opção confiável graças à sua baixa latência. Para o chat e o agente: Qwen 3.5 9B em 8 GB, Devstral 24B ou gpt-oss 20B em 16 GB, Qwen 3.6 35B-A3B se você tiver memória de sobra. Devstral, especialista em agentes de código, é uma excelente alternativa. Regra simples: um modelo leve para o preenchimento automático, um modelo maior para o raciocínio.
É preciso ter uma GPU potente para isso?+
Não. 8 GB de VRAM são suficientes para um Qwen 3.5 9B em Q4 (chat) mais um pequeno modelo FIM para completar código. Abaixo disso, continue com modelos FIM leves que mantenham respostas rápidas. Um Mac M2/M3 com 16 GB de memória unificada também faz um ótimo trabalho.

#Para se aprofundar

Você tem um copiloto local rodando. Três direções lógicas de acordo com seu perfil:

Aprofundar o conhecimento sobre o Cline
O guia dedicado ao Copilot local com Cline aprofunda a configuração: provedor Ollama, modo agente, autocompletar via Tabby/Twinny e ajustes finos para o uso de agentes.
Você vinha do Continue.dev
Guia de migração Continue → Cline detalha a transição (configurações equivalentes, modelos, dados locais).
Escolher seu hardware
Antes de passar para um modelo de 14B ou 32B, o guia Escolher seu GPU para IA local ajuda você a evitar a compra de um GPU com VRAM insuficiente.

Se você quiser economizar tempo com os ajustes, o guia pago “Copiloto de código local” fornece um pacote completo de configurações Ollama + Cline + Aider prontas para usar e colar, tanto para uma estação de trabalho individual quanto para uma equipe.

Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.