Melhor LLM local para programar: Devstral, Qwen3-Coder
O melhor LLM local para programar em 2026 já não é uma questão retórica: Devstral, Qwen3-Coder e a nova geração Qwen 3.5 / 3.8 concorrem agora seriamente com os assistentes na nuvem, inclusive em tarefas agênticas. Este guia compara os modelos open-weight de código disponíveis, seus requisitos de VRAM, sua qualidade real de geração e dá uma recomendação clara de acordo com a sua GPU. Sem classificação abstrata: recomendações concretas com base na máquina que você tem à disposição.
#Por que usar um LLM local para programar em 2026
Codar com um assistente de IA tornou-se um hábito. Mas enviar código proprietário, segredos, caminhos internos ou simplesmente propriedade intelectual para um serviço na nuvem continua sendo um problema — para freelancers sob NDA, para empresas sujeitas ao RGPD, para desenvolvedores que trabalham sozinhos e querem apenas manter o controle.
A boa notícia: desde 2025, os modelos de código com pesos abertos recuperaram boa parte do atraso. Devstral atinge pontuações no SWE-bench dignas dos melhores modelos na nuvem, Qwen3-Coder compete de igual para igual com Claude em refatoração, e até um Qwen 3.5 9B em uma RTX 3060 faz trabalho útil no dia a dia. O custo inicial do hardware caiu e a qualidade subiu.
#Os bons critérios de escolha
Devstral ou Qwen3-Coder: sua escolha está feita. O kit Copiloto Local o coloca para trabalhar em trinta minutos (cap. 2), verifica se é o modelo adequado para sua memória de vídeo (cap. 5) e leva você a medir o desempenho da sua máquina em vez de acreditar na ficha técnica (cap. 18).
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Um benchmark de leaderboard não diz tudo. Para uso real, veja o que realmente importa.
- Qualidade do código gerado
- Capacidade de escrever um patch que compile e passe nos testes, não apenas algo com aparência de código. HumanEval/MBPP dão uma ideia; SWE-bench Verified é mais representativo das tarefas reais.
- Suporte ao Fill-in-the-Middle (FIM)
- Indispensável para o preenchimento automático no IDE. Nem todos os modelos oferecem esse recurso — o Devstral é fraco nesse aspecto, e, para FIM puro, qwen2.5-coder:7b-base continua sendo a referência em 2026.
- Janela de contexto
- Para compreender um arquivo de 2000 linhas ou um projeto inteiro, considere pelo menos 32k tokens. Qwen3-Coder atinge 256k, Devstral atinge 128k.
- Velocidade de inferência
- Um modelo denso de 30B gera 15 a 25 tokens/s em uma RTX 4090. Um modelo MoE como Qwen3-Coder 30B-A3B gera 60 a 80 tokens/s com qualidade equivalente — a diferença muda a vida no teclado.
- Licença
- Apache 2.0 e MIT permitem o uso comercial sem complicações. Cuidado com o Codestral (uso não comercial) ou os antigos Code Llama (licença restritiva da Meta).
- Linguagens suportadas
- A maioria dos bons modelos cobre Python, JS/TS, Go, Rust, Java, C/C++ corretamente. Para PHP, Ruby ou Swift, verifique os benchmarks por linguagem.
#Devstral, especialista em tarefas com agentes (Mistral AI)
Devstral é o modelo de código da Mistral, especificamente treinado para trabalhar com agentes — ou seja, com um agente como Aider, OpenHands ou SWE-agent que itera sobre o código, executa testes, lê a saída e faz correções. No SWE-bench Verified, o Devstral Small está entre os melhores modelos com pesos abertos, em uma posição que há um ano seria impossível de alcançar.
- Variante recomendada
- Devstral Small (~24B, denso). Apache 2.0. Disponível no Hugging Face e Ollama.
- VRAM em Q4_K_M
- Aproximadamente 14 GB. Cabe com folga em uma RTX 4080 de 16 GB ou em um Mac M-series de 24 GB. É possível com 12 GB e contexto reduzido, mas fica no limite.
- Janela de contexto
- 128k tokens. Mais do que suficiente para processar um repositório de tamanho médio.
- Ponto forte
- Excelente para workflows agênticos de múltiplas etapas: ler um relatório de bug, navegar no código, escrever um patch e fazer os testes passarem.
- Fraqueza
- Não foi projetado para FIM (autocompletar linha por linha). Se você quiser usá-lo no Continue.dev para autocompletar código, mude para qwen2.5-coder:7b-base nessa parte.
#Qwen3-Coder, a ferramenta multifuncional (Alibaba)
Qwen3-Coder é a geração 2025 da família Coder da Alibaba, com arquitetura Mixture-of-Experts (MoE). É o modelo que muitos consideram o estado da arte entre os modelos com pesos abertos para geração de código em 2026, independentemente do formato. Disponível sob licença Apache 2.0.
- Versão para o público em geral
- Qwen3-Coder 30B-A3B: 30 bilhões de parâmetros no total, mas apenas 3 bilhões ativados por token. Na prática, isso oferece a qualidade de um modelo denso de 14–22B com a velocidade de um de 3B.
- VRAM em Q4_K_M
- Aproximadamente 18 GB para a 30B-A3B. Cabe exatamente em uma RTX 4090 de 24 GB, ou em um Mac M-Pro/M-Max de 24-32 GB.
- Variante de fronteira
- Qwen3-Coder 480B-A35B. No nível de Claude/GPT-5 em programação, mas restrito a Mac Studio Ultra com 256-512 GB ou a configurações com múltiplas GPUs H100.
- Contexto
- 256k tokens de contexto nativo, com possibilidade de expansão. Você pode literalmente colar um repositório inteiro nele.
- Pontos fortes
- Excelente em refatoração de múltiplos arquivos, lida bem com linguagens “de nicho” (Elixir, Zig, OCaml), muito bom em tarefas com agentes, e o MoE o torna excepcionalmente rápido.
- Fraqueza
- O 30B-A3B continua sendo um MoE: se sua VRAM estiver apertada, o consumo adicional de memória em relação a um 9B denso será perceptível. Para 12 GB, fique com um Qwen 3.5 9B (se necessário, em Q8).
#Qwen 3.5, a opção confiável para configurações pequenas
A família Qwen 3.5 (2B, 4B, 9B) em 2026 é a opção mais versátil para configurações modestas. Licença Apache 2.0, contexto amplo (até 256k), multimodal nas versões de tamanho médio e disponível em variantes que cabem em 4 a 12 GB de VRAM. Especificamente para a autocompletação inline (FIM), mantemos à parte o qwen2.5-coder:7b-base, que continua sendo a referência nesse caso específico.
- Qwen 3.5 4B
- VRAM Q4 ≈ 3,4 GB (ollama run qwen3.5:4b). Ideal para RTX 3060 8 GB, RTX 4060, MacBook Air M-series 16 GB. O novo modelo pequeno padrão, adequado para conversas sobre código.
- Qwen 3.5 9B
- VRAM Q4 ≈ 6,6 GB (ollama run qwen3.5:9b). A escolha por excelência para 8 GB em 2026: 256k de contexto, visão, qualidade significativamente superior ao 4B. O modelo para uso diário em placas de 8 a 12 GB.
- Qwen 3.5 9B em Q8
- VRAM ≈ 11 GB (ollama run qwen3.5:9b-q8_0). A melhor qualidade nessa faixa, ideal para 12 GB de VRAM (RTX 3060 12 GB, RTX 4070).
- Autocompletação (FIM)
- Qwen2.5-Coder 7B base continua sendo A referência em FIM em 2026: ollama run qwen2.5-coder:7b-base (≈ 4,7 GB). Manter para o tabAutocomplete do VS Code (Continue.dev, Tabby).
#Alternativas notáveis
- gpt-oss 20B (OpenAI)
- Modelo da OpenAI com pesos abertos, quantizado em MXFP4, muito rápido, com 131k de contexto. VRAM ≈ 14 GB (ollama run gpt-oss:20b). Bom equilíbrio em 16 GB se você quiser um modelo generalista voltado para código e com respostas rápidas.
- GLM 4.7 Flash (Zhipu AI)
- MoE 30B-A3B, licença MIT, ≈ 19 GB em Q4 (ollama run glm-4.7-flash). Muito sólido em conversas técnicas, em depuração e em agentes. Pertinente se você misturar francês e código — as explicações saem naturalmente em francês.
- Mistral Small 24B
- Modelo generalista denso, ≈ 14 GB em Q4 (ollama run mistral-small). Bom em francês, útil como complemento para documentação e explicações em uma configuração de 16 GB.
- Codestral 22B (Mistral)
- Tecnicamente correto, mas com licença Mistral para uso não produtivo: proibido em ambiente de trabalho. Descartar se o uso não for estritamente pessoal ou para pesquisa.
- DeepSeek-Coder V2, Code Llama, StarCoder 2
- Essas bases de 2023-2024 são superadas em qualidade por tudo o que foi apresentado acima. Pode ignorá-las: um Qwen 3.5 9B ou um Granite 4.2 8B oferece resultados melhores usando menos VRAM.
#Qual escolher de acordo com sua GPU
Recomendação pragmática com base na VRAM disponível. Os modelos citados estão em quantização Q4_K_M, o melhor equilíbrio entre qualidade e memória para código.
- 8 GB (RTX 3060 8 GB, 4060, 5050, 5060)
- Qwen 3.5 9B (256k ctx, visão). Já é muito útil para autocompletar e para conversas técnicas. Para o FIM puro, adicione qwen2.5-coder:7b-base. Contexto 16-32k.
- 12 GB (RTX 3060 12 GB, 4070, 5070)
- Qwen 3.5 9B em Q8 (11 GB) em uso diário, ou Gemma 4 12B (7,6 GB, multimodal). Devstral em Q4 funciona com contexto reduzido.
- 16 GB (RTX 4080, 4070 Ti Super, 5070 Ti, 5080)
- Devstral 24B para tarefas com agentes, gpt-oss 20B ou Mistral Small 24B como modelos generalistas, e qwen2.5-coder:7b-base para o FIM. É a primeira configuração em que você realmente tem escolha.
- 24 GB (RTX 3090, 4090, RX 7900 XTX)
- Qwen3-Coder 30B-A3B (código) ou Qwen 3.8 27B (generalista, o mais próximo de um Copilot) como modelo principal para uso diário. Devstral como alternativa para tarefas com agentes, GLM 4.7 Flash para os agentes. É a configuração em que os modelos locais rivalizam com os da nuvem no dia a dia.
- 32 GB (RTX 5090) ou Mac M-series 36-48 GB
- Qwen3-Coder 30B-A3B em Q8 (32 GB), ou Qwen 3.6 35B-A3B (23 GB, MoE rápido, a opção confiável dessa faixa). Excelente conforto de uso, contexto 128k+. O objetivo é alcançar o topo sem concessões.
- Mac Studio Ultra 128 GB+
- Qwen3-Coder 30B-A3B em Q8 com qualidade plena e a janela de contexto completa de 256k, ou as variantes frontier do Qwen3-Coder (480B-A35B) se você busca o nível das APIs. É o único meio acessível (fora de um data center) de rodar um modelo de código frontier localmente.
#Conectar tudo isso no VS Code
A solução mais simples: Ollama escuta em http://localhost:11434, e o Continue.dev (extensão do VS Code) sabe se comunicar com esse endpoint nativamente. Aqui está uma configuração mínima que combina qwen2.5-coder:7b-base para autocompletar (rápido, FIM) e Qwen3-Coder para o chat (poderoso).
Para fluxos de trabalho com agentes (refatoração de múltiplos arquivos, resolução de bugs), o Aider na linha de comando destaca-se especialmente com Devstral:
#Dicas e armadilhas comuns
- Contexto muito curto por padrão no Ollama
- Ollama limita o contexto a 2048 tokens por padrão. Para código, isso é ridículo. Configure num_ctx via um Modelfile ou pelos parâmetros do Continue.dev e aumente para 16k ou 32k, no mínimo.
- FIM vs chat — não misture
- Devstral e Qwen3-Coder não são otimizados para FIM. Se você os usar na autocompletação, obterá resultados estranhos (respostas em estilo de chat no meio de uma função). Sempre use um modelo adequado para FIM (qwen2.5-coder:7b-base) para o tabAutocomplete.
- Quantização excessivamente agressiva
- Para código, Q3 e abaixo degradam claramente a qualidade (sintaxe errada, identificadores inventados). Mantenha pelo menos Q4_K_M. Q5_K_M se tiver VRAM.
- Desempenho que despenca após alguns minutos
- O Ollama descarrega modelos inativos após 5 minutos. Se você programa de forma intermitente, inicie o Ollama com OLLAMA_KEEP_ALIVE=1h para manter o modelo carregado e pronto para uso.
- Modelo que sempre responde em inglês
- Adicione um prompt de sistema no Continue.dev ou no Modelfile: “Responda sempre em francês, com código e comentários em inglês.” Qwen 3.5 / 3.8 e Devstral seguem essa instrução sem dificuldade.
- Qwen 3.8 27B que reflete excessivamente
- Com sua configuração padrão de raciocínio, o Qwen 3.8 27B tende a refletir demais em tarefas simples e a aumentar a latência. Para programar no dia a dia, defina o esforço de raciocínio como low (ou desative o thinking): você obtém respostas mais rápidas sem perda significativa nas tarefas comuns.
#Para se aprofundar
Você escolheu seu modelo de código e ele está rodando. Algumas dicas para avançar ainda mais:
- Copilot local com Continue.dev
- O guia detalhado para configurar o Continue.dev no VS Code com Ollama, modelos separados para preenchimento automático e chat, e atalhos.
- Usar Ollama em Claude Code e Cursor
- Para conectar Devstral ou Qwen3-Coder no Cursor ou no Claude Code via o endpoint compatível com OpenAI do Ollama, e usar esses ambientes de desenvolvimento de alto nível sem necessidade de nuvem.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para entender exatamente o que você perde ou ganha ao passar de um Q4_K_M para um Q5_K_M em um modelo de código, e quando usar uma quantização de maior precisão faz sentido.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.