Trilha 02 · Para programar

O desenvolvedor — « Copilot local, 100% offline, 0 latência de nuvem. »

Qwen2.5 Coder 32B conectado ao VSCode via Continue.dev. Autocompletar, chat e refatoração de um arquivo inteiro — sem que uma única linha do seu código vaze para a Microsoft, a OpenAI ou a Anthropic. Seu PR contém uma chave de API? Ela permanece nele.

Duração total
~30 min
Nível exigido
Confortável com terminal
Custo
0 €
Máquina típica
GPU com 16 GB de VRAM ou Mac M-series 32 GB+
↑
Nossa promessa

Ao final deste percurso, você terá um servidor llama.cpp rodando em segundo plano com Qwen2.5 Coder 32B em quantização Q4. O Continue.dev estará conectado ao VSCode com autocompletar (FIM) e chat na barra lateral. A latência ficará abaixo de 100 ms, e a qualidade do autocompletar será comparável à do Copilot, às vezes melhor em código recente.

Para quem este percurso foi pensado

Preferimos avisar você logo a deixar você perder 30 minutos à toa.

✓ É para você se
  • ✓Você programa todos os dias e está cansado de copiar seus trechos de código para uma interface web.
  • ✓Seu empregador proíbe GitHub Copilot, ChatGPT, Cursor — por boas razões.
  • ✓Você trabalha com código proprietário, sob NDA, ou com segredos de API em texto claro.
  • ✓Você tem uma RTX 4070 Ti+, RTX 4090, RTX 5090 ou um MacBook Pro M2/M3/M4 com 32 GB+
  • ✓O ping de 200 ms para as APIs cloud interrompe o fluxo.
✕ Procure outras opções se
  • ·Você tem 8 GB de VRAM: é viável, mas com um modelo de 7B, a qualidade fica bem abaixo da do Copilot.
  • ·Você programa 1 hora por semana: uma conta gratuita com um provedor de nuvem dará menos dor de cabeça.
  • ·Você quer um assistente de chat para uso geral: veja o percurso para curiosos, que é mais simples.

O percurso em 4 etapas

Cada etapa leva a um guia detalhado que você pode ler em paralelo. A ordem foi otimizada: não pule nenhuma etapa na primeira vez.

Acumulado · ~30 min
  1. 1
    Etapa 01·12 min·Avançado

    Compilar llama.cpp com aceleração GPU

    Compile a partir do código-fonte para obter o máximo de tokens/seg. Em NVIDIA: CUDA. Em Apple Silicon: Metal. Em AMD: ROCm. É 15 a 30% mais rápido que Ollama.

    Binário llama-server pronto, capaz de disponibilizar uma API compatível com a API da OpenAI.
    Leia o guia →
  2. 2
    Etapa 02·6 min·Intermediário

    Baixar Qwen2.5 Coder 32B (Q4)

    Melhor modelo de código com pesos abertos da sua categoria. Q4_K_M cabe em ~19 GB de VRAM, mantém 95% da qualidade do FP16. Download pelo Hugging Face.

    O modelo é servido em localhost:8080 no formato chat completions.
    Leia o guia →
  3. 3
    Etapa 03·8 min·Intermediário

    Conectar Continue.dev ao VSCode

    Instalar a extensão Continue pelo marketplace, editar ~/.continue/config.json para apontar para seu endpoint local e configurar o modelo FIM para o preenchimento automático.

    Tab para aceitar uma sugestão, Cmd+L para abrir o chat sobre o trecho selecionado.
    Leia o guia →
  4. +
    Etapa bonus·4 min·Avançado

    Bônus — Ajudar na linha de comando

    Para tarefas mais amplas (refatoração de um módulo, geração de testes), Aider permite editar arquivos em linguagem natural a partir do terminal, com commit automático no git.

    Uma CLI com recursos de agente conectada ao mesmo backend, complementar ao Continue.
    Leia o guia →

Modelos recomendados

Três opções testadas para este percurso — da mais leve à mais capaz. Clique para ver a ficha detalhada (VRAM, contexto e benchmarks).

Modelo referenciado
qwen2.5-14b

O polivalente. 14B = 9 GB em Q4, qualidade de código excelente, cabe em 12 GB de VRAM.

O polivalente
Mistral Small 3
Mistral AI · 24B · 14 GB em Q4

Bom equilíbrio se você tiver 16 GB de VRAM, com um perfil mais generalista.

Veja o detalhamento →
Modelo referenciado
llama-3.3-70b

O melhor, se você tiver um Mac com 64 GB ou um GPU com 48 GB. Latência maior, mas qualidade superior.

Perguntas frequentes

As perguntas reais que recebemos por e-mail e no Mastodon. Se a sua não estiver aqui, abra um ticket.

Na autocompletação linha a linha, Qwen2.5 Coder 32B é muito próximo, às vezes melhor em código recente (após 2024). No chat, Copilot Chat (com GPT-4o por trás) continua um passo à frente. Mas você mantém o controle sobre seus dados.
Após concluir este percurso
Próximo percurso

O profissional com documentos confidenciais — « Meus arquivos não saem do meu computador. »

Jurista, médico, profissional de RH, consultor, contador, tabelião — seus documentos estão protegidos por sigilo profissional ou NDA. Um LLM local acoplado a um RAG permite que você os consulte, resuma,…

→
O kit Copiloto Local

Substitua o GitHub Copilot e o Cursor por um copiloto de código 100 % local — o guia de referência, com configurações incluídas.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Uma pergunta, um erro de digitação, um bug?

Este caminho evolui a cada lançamento de modelo. Seus feedbacks são a matéria-prima.