O desenvolvedor — « Copilot local, 100% offline, 0 latência de nuvem. »
Qwen2.5 Coder 32B conectado ao VSCode via Continue.dev. Autocompletar, chat e refatoração de um arquivo inteiro — sem que uma única linha do seu código vaze para a Microsoft, a OpenAI ou a Anthropic. Seu PR contém uma chave de API? Ela permanece nele.
Ao final deste percurso, você terá um servidor llama.cpp rodando em segundo plano com Qwen2.5 Coder 32B em quantização Q4. O Continue.dev estará conectado ao VSCode com autocompletar (FIM) e chat na barra lateral. A latência ficará abaixo de 100 ms, e a qualidade do autocompletar será comparável à do Copilot, às vezes melhor em código recente.
Para quem este percurso foi pensado
Preferimos avisar você logo a deixar você perder 30 minutos à toa.
- ✓Você programa todos os dias e está cansado de copiar seus trechos de código para uma interface web.
- ✓Seu empregador proíbe GitHub Copilot, ChatGPT, Cursor — por boas razões.
- ✓Você trabalha com código proprietário, sob NDA, ou com segredos de API em texto claro.
- ✓Você tem uma RTX 4070 Ti+, RTX 4090, RTX 5090 ou um MacBook Pro M2/M3/M4 com 32 GB+
- ✓O ping de 200 ms para as APIs cloud interrompe o fluxo.
- ·Você tem 8 GB de VRAM: é viável, mas com um modelo de 7B, a qualidade fica bem abaixo da do Copilot.
- ·Você programa 1 hora por semana: uma conta gratuita com um provedor de nuvem dará menos dor de cabeça.
- ·Você quer um assistente de chat para uso geral: veja o percurso para curiosos, que é mais simples.
O percurso em 4 etapas
Cada etapa leva a um guia detalhado que você pode ler em paralelo. A ordem foi otimizada: não pule nenhuma etapa na primeira vez.
- 1Etapa 01·12 min·Avançado
Compilar llama.cpp com aceleração GPU
Compile a partir do código-fonte para obter o máximo de tokens/seg. Em NVIDIA: CUDA. Em Apple Silicon: Metal. Em AMD: ROCm. É 15 a 30% mais rápido que Ollama.
Binário llama-server pronto, capaz de disponibilizar uma API compatível com a API da OpenAI.Leia o guia → - 2Etapa 02·6 min·Intermediário
Baixar Qwen2.5 Coder 32B (Q4)
Melhor modelo de código com pesos abertos da sua categoria. Q4_K_M cabe em ~19 GB de VRAM, mantém 95% da qualidade do FP16. Download pelo Hugging Face.
O modelo é servido em localhost:8080 no formato chat completions.Leia o guia → - 3Etapa 03·8 min·Intermediário
Conectar Continue.dev ao VSCode
Instalar a extensão Continue pelo marketplace, editar ~/.continue/config.json para apontar para seu endpoint local e configurar o modelo FIM para o preenchimento automático.
Tab para aceitar uma sugestão, Cmd+L para abrir o chat sobre o trecho selecionado.Leia o guia → - +Etapa bonus·4 min·Avançado
Bônus — Ajudar na linha de comando
Para tarefas mais amplas (refatoração de um módulo, geração de testes), Aider permite editar arquivos em linguagem natural a partir do terminal, com commit automático no git.
Uma CLI com recursos de agente conectada ao mesmo backend, complementar ao Continue.Leia o guia →
Modelos recomendados
Três opções testadas para este percurso — da mais leve à mais capaz. Clique para ver a ficha detalhada (VRAM, contexto e benchmarks).
O polivalente. 14B = 9 GB em Q4, qualidade de código excelente, cabe em 12 GB de VRAM.
Bom equilíbrio se você tiver 16 GB de VRAM, com um perfil mais generalista.
Veja o detalhamento →O melhor, se você tiver um Mac com 64 GB ou um GPU com 48 GB. Latência maior, mas qualidade superior.
Perguntas frequentes
As perguntas reais que recebemos por e-mail e no Mastodon. Se a sua não estiver aqui, abra um ticket.
O profissional com documentos confidenciais — « Meus arquivos não saem do meu computador. »
Jurista, médico, profissional de RH, consultor, contador, tabelião — seus documentos estão protegidos por sigilo profissional ou NDA. Um LLM local acoplado a um RAG permite que você os consulte, resuma,…
Substitua o GitHub Copilot e o Cursor por um copiloto de código 100 % local — o guia de referência, com configurações incluídas.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Uma pergunta, um erro de digitação, um bug?
Este caminho evolui a cada lançamento de modelo. Seus feedbacks são a matéria-prima.