IntelliJ e JetBrains + Ollama: o assistente de IA local no seu IDE
Integrar o IntelliJ (ou PyCharm, WebStorm, GoLand…) ao Ollama é ter um assistente de código no estilo Copilot, mas que roda na sua máquina: chat sobre seu projeto, autocompletar no fim da linha, refatoração — sem que uma única linha seja enviada a um servidor de terceiros. Este guia seleciona os plugins compatíveis com o Ollama, mostra como conectar tudo por meio de um « proxy AI » e indica quais modelos de código escolher de acordo com sua placa de vídeo.
#Por que um LLM local no seu IDE
Assistentes na nuvem (GitHub Copilot, JetBrains AI, Cursor) são práticos, mas enviam o contexto do seu código — às vezes o arquivo inteiro, às vezes todo o repositório — para servidores remotos. Para código sob NDA, software proprietário ou simplesmente por princípio, isso é inaceitável. Um LLM local integrado ao IntelliJ resolve o problema pela raiz: o modelo roda na sua GPU, e o prompt e a resposta gerada nunca saem da máquina.
O outro argumento é o custo. Uma assinatura do Copilot ou do JetBrains AI é paga mensalmente, indefinidamente. Uma vez instalado o Ollama e baixado um modelo de código, você usa a compleção de código e conversa sem cotas, sem cobrança por token, inclusive offline. A contrapartida está na qualidade: um pequeno modelo local não se iguala a um modelo de ponta em nuvem, mas um Qwen 3.8 27B ou um Devstral 24B se aproxima dele na compleção e nas conversas do dia a dia.
- Privacidade
- O código, os prompts e as respostas permanecem locais. Nada é registrado em logs na nuvem.
- Sem assinatura
- Nenhum custo recorrente após o modelo ser baixado. Uso ilimitado.
- Offline
- Funciona no trem, em uma rede isolada ou atrás de um proxy corporativo com restrições rigorosas.
- Controle do modelo
- Você escolhe o tamanho, a quantização e pode mudar de modelo conforme a tarefa.
#Plugins JetBrains que falam com Ollama
Este guia leva você ao modelo. O kit leva você ao copiloto que programa no seu editor.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
O ecossistema JetBrains não oferece suporte nativo universal ao Ollama: é necessário usar um plugin do marketplace. Três opções cobrem quase todas as necessidades, cada uma com um ponto forte diferente.
- ProxyAI (ex-CodeGPT)
- O mais completo para uso local. Chat, autocompletar em linha, edição do trecho selecionado e um conector Ollama integrado. É o “proxy AI” mencionado no título: ele faz a ponte entre a IDE e o daemon Ollama.
- Continue
- Open source, com muitas opções de ajuste por meio de um arquivo de configuração. Chat, autocompletação e ações sobre o código, com suporte de primeira classe ao Ollama como provedor. Ideal se você quiser ajustar cada modelo com precisão.
- JetBrains AI Assistant
- O assistente oficial da JetBrains. Desde 2025, ele permite se conectar a um modelo local via Ollama ou LM Studio para o modo offline. Útil se você quiser continuar usando a ferramenta da própria JetBrains, mas menos flexível para a conclusão local de código.
#Pré-requisitos
Supõe-se que Ollama já esteja instalado e funcionando. O restante exige apenas um IDE JetBrains recente e pelo menos um modelo de código baixado.
- Um IDE JetBrains 2024.1+
- IntelliJ IDEA, PyCharm, WebStorm, GoLand, Rider, PhpStorm… Os plugins acima podem ser instalados em toda a linha por meio do mesmo marketplace.
- Ollama funcionando
- O daemon instalado e acessível em http://localhost:11434. Teste com o comando ollama list antes de configurar qualquer coisa.
- Um modelo de chat/código
- qwen3.5:9b é um bom ponto de partida versátil (256k de contexto, visão). Em Q4_K_M, cabe em aproximadamente 6,6 GB de VRAM.
- Uma GPU recomendada
- O preenchimento automático deve responder em menos de um segundo para ser útil. Uma RTX 3060 de 12 GB roda um 7B com folga; sem GPU, limite-se ao chat, não ao preenchimento automático.
#Configurar ProxyAI + Ollama
ProxyAI (anteriormente CodeGPT) é o caminho mais direto para um assistente local completo nos IDEs da JetBrains. Seu conector Ollama gerencia o chat, a edição do trecho selecionado e a autocompletação, sem chave de API nem conta.
- 01Instalar o pluginSettings → Plugins → Marketplace, procure «ProxyAI» (ou «CodeGPT» conforme a versão) e instale-o. Reinicie o IDE se solicitado.
- 02Escolher o fornecedor OllamaSettings → Tools → ProxyAI → Providers. Selecione Ollama (Local) como provedor, em vez das opções de nuvem (OpenAI, Anthropic…).
- 03Verificar a URL do servidorO campo Base URL deve apontar para http://localhost:11434. Se o Ollama estiver rodando em outra máquina da rede, coloque o endereço IP dela no lugar de localhost.
- 04Selecionar o modeloNa lista de modelos, escolha o que você baixou (por exemplo, qwen3.5:9b). O ProxyAI consulta o Ollama para listar os modelos disponíveis.
- 05Testar o chatAbra o painel ProxyAI (ícone na barra lateral), faça uma pergunta sobre um arquivo aberto. A resposta deve chegar localmente, sem aviso de conexão externa.
#Continue e o AI Assistant nativo
Se você preferir configurar cada detalhe, o Continue disponibiliza sua configuração em um arquivo em vez de menus. Nesse arquivo, você declara explicitamente o provedor Ollama, o modelo de chat e — separadamente — o modelo de completamento. Isso exige mais texto, mas é muito mais preciso, especialmente para atribuir um modelo pequeno e rápido ao completamento automático e um maior ao chat.
No JetBrains AI Assistant, o procedimento é mais estruturado: nas configurações do assistente, ative o uso de modelos locais e configure a conexão com o Ollama. Isso é útil para manter uma única ferramenta, mas o assistente nativo continua sendo pensado principalmente para a nuvem da JetBrains; sua funcionalidade de completar código localmente é menos madura que a do ProxyAI ou do Continue. Para um uso sério e 100% local, recomendamos esses dois últimos.
#Quais modelos de código escolher de acordo com sua VRAM
A regra é simples: quanto maior o modelo, melhores são suas respostas, mas maior é seu consumo de VRAM e mais lentamente ele responde. As famílias Qwen 3.5 / Qwen 3.8 cobrem toda a gama e são referências em 2026 para programação com modelos locais; Devstral 24B (especializado em agentes de programação) e Granite 4.2 são boas alternativas. Aqui estão os valores de referência com quantização Q4_K_M (o melhor equilíbrio entre tamanho e qualidade).
- Leve 3B — ~2 GB VRAM
- granite4.2:3b. Ajuda rápida para resolver problemas, perguntas simples, consumo de recursos muito baixo. Roda até em uma GPU pequena ou na CPU para uso não interativo.
- Polivalente 9B — ~6,6 GB de VRAM
- qwen3.5:9b. O ponto de equilíbrio: desempenho satisfatório em chat, edição e refatoração, 256k de contexto e visão. Destinado a uma RTX 3060 de 12 GB / 4070 de 12 GB.
- Conforto com 12B — ~7,6 GB de VRAM
- gemma4:12b. Muito melhor em raciocínio e refatorações que envolvem vários arquivos, multimodal e sob licença Apache 2.0. Funciona bem em uma RTX 4080 de 16 GB.
- Topo de linha 27B — ~18 GB de VRAM
- qwen3.8:27b. O mais próximo da nuvem para código local (262k de contexto, visão). Exige uma RTX 4090 de 24 GB ou um Mac Apple Silicon com 32 GB ou mais de memória unificada. Dica: altere seu raciocínio para "low", ele tende a refletir demais por padrão.
#Autocompletação local: atenção ao FIM
O preenchimento de código no estilo Copilot baseia-se no « fill-in-the-middle » (FIM): o modelo deve completar o código no meio, conhecendo o que vem antes E o que vem depois do cursor. Nem todos os modelos oferecem suporte a isso. As variantes instruct são treinadas para chat, não para FIM — para o preenchimento automático, use as variantes base, especificamente projetadas para isso.
- Modelo base, não instruct
- Para a autocompletação, escolha qwen2.5-coder:7b-base, que continua sendo a referência em FIM em 2026. Um modelo instruct produzirá sugestões de autocompletação prolixas ou fora do formato.
- Rápido acima de tudo
- Na autocompletação, a velocidade importa mais que o refinamento. Um modelo base dedicado que responde em menos de meio segundo é mais útil do que um modelo grande de chat que leva 2 segundos.
- GPU quase obrigatória
- Sem aceleração de hardware, as sugestões de autocompletar chegam tarde demais para acompanhar a digitação. Reserve então a IA local para o chat.
#O que a IA local ainda não faz na IDE
A IA local avançou, mas ainda há diferenças em relação aos assistentes de ponta na nuvem. Vale a pena conhecê-las para ajustar suas expectativas e evitar decepções.
- O raciocínio envolvendo vários arquivos
- Os grandes repositórios ultrapassam a janela de contexto dos modelos locais. O modelo vê os arquivos que você lhe fornece, não a sua arquitetura inteira. Copilot Workspace ou Cursor indexam todo o projeto; localmente, isso ainda é feito de forma artesanal.
- Modos avançados de agente
- Fazer executar comandos, rodar testes e iterar em loop (como no Cline/Cursor Agent) exige um modelo que gerencie o uso de ferramentas de forma confiável. Os pequenos modelos locais frequentemente falham nessa tarefa; é preciso buscar um modelo dedicado à programação (Devstral 24B, Qwen3-Coder 30B ou GLM 4.7 Flash) e aceitar falhas.
- A qualidade intrínseca em tarefas de código complexo
- Sobre algoritmos avançados ou frameworks recentes pouco representados no treinamento, um modelo local de 8 a 12B continua atrás de um modelo em nuvem de ponta.
- A integração refinada ao produto
- Detecção automática da linguagem, numerosas ações contextuais, resolução de PR… as ferramentas locais estão diminuindo a diferença, mas ainda ficam um passo atrás da experiência refinada dos assistentes comerciais.
Na prática, a execução local se destaca na completação, no chat sobre um arquivo, na explicação de código e na refatoração localizada. Para tarefas complexas com agentes e a análise de um repositório inteiro, a nuvem mantém a vantagem — daí o interesse em manter as duas opções e direcionar as solicitações conforme a sensibilidade do código.
#Solução de problemas
- O plugin não lista nenhum modelo
- O plugin não consegue se conectar ao Ollama. Verifique se o daemon está rodando (ollama list) e se a URL é mesmo http://localhost:11434. Se Ollama estiver em outra máquina, inicie-o com OLLAMA_HOST=0.0.0.0 e aponte para o IP dessa máquina.
- « Connection refused »
- O Ollama não está em execução ou um firewall está bloqueando a porta 11434. Teste com curl http://localhost:11434/api/tags na mesma máquina em que o IDE está rodando.
- O modelo não aparece na lista
- A tag não corresponde. Copie o nome exato retornado por ollama list, incluindo a tag (qwen3.5:9b e não qwen3.5).
- Respostas muito lentas
- O modelo não cabe inteiramente na VRAM e é executado parcialmente na CPU. Mude para um modelo menor ou para Q4_K_M e verifique com nvidia-smi se a GPU está de fato sendo utilizada.
- Completação vazia ou absurda
- Você está usando um modelo instruct para o FIM. Mude para uma variante -base (qwen2.5-coder:7b-base).
- O IDE fica lento durante a geração
- Dois modelos carregados saturam a VRAM. Reduza o tamanho de um deles ou ative apenas um plugin de cada vez.
#Para se aprofundar
A utilidade do assistente local no IDE depende do daemon e da GPU que o sustentam. Esses guias complementam a configuração.
- Instalar Ollama
- Base: instalar e iniciar o daemon que serve seus modelos de código na porta 11434.
- Copilot gratuito local: Cline, Tabby & CodeGeeX no VS Code
- O equivalente no VS Code, para comparar as abordagens e os plugins entre editores.
- Usar Ollama em Claude Code e Cursor
- Para conectar os mesmos modelos locais em outros assistentes e decidir entre local e nuvem de acordo com a tarefa.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.