Phi-4 localmente: instalar com Ollama, VRAM e velocidade
Phi-4 é o pequeno modelo da Microsoft que causou muita repercussão no final de 2024: apenas 14 bilhões de parâmetros, mas com pontuações em matemática e programação que rivalizam com as de modelos três vezes maiores. Este guia mostra como instalar o Phi-4 localmente com Ollama, o que ele realmente oferece na prática e onde decepciona — especialmente em francês.
#Por que Phi-4?
Phi-4 é a sequência lógica da família Phi da Microsoft Research: modelos de pequeno porte, treinados principalmente com dados sintéticos cuidadosamente elaborados, pensados para competir com modelos muito maiores em tarefas de raciocínio. A versão 4, lançada no final de 2024, expande essa abordagem para 14B de parâmetros e alcança resultados notáveis em GPQA, MATH e HumanEval — muitas vezes acima de Llama 3.3 70B nesses benchmarks específicos.
Na prática, é um modelo que cabe em 9 GB de VRAM em Q4_K_M, portanto acessível a uma GPU de entrada com 12 GB, como uma RTX 3060 ou uma RTX 4070. E ele se sai razoavelmente bem mesmo usando apenas a CPU, desde que você tenha 16 GB de RAM. É esse equilíbrio entre tamanho e qualidade que o torna um excelente candidato para auto-hospedagem com recursos modestos.
#Pré-requisitos
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- Ollama instalado
- Windows, macOS ou Linux. Se você ainda não instalou o Ollama, seguir o guia de instalação leva 3 minutos.
- VRAM para a quantização Q4_K_M
- ≈ 9 GB. Uma RTX 3060 de 12 GB, uma RTX 4070 de 12 GB ou um Mac com 16 GB de memória unificada passam sem problemas.
- RAM do CPU se não houver GPU
- No mínimo 16 GB para Q4. Espere de 4 a 8 tokens/s em um Ryzen 5 ou Core i5 recente — utilizável para testes, mas não para um chat fluido.
- 10 GB de espaço em disco
- O modelo Q4_K_M pesa aproximadamente 9 GB. Reserve mais se quiser também testar o Phi-4-Mini em paralelo.
#1. Instalar o Ollama
Se o Ollama já está instalado, pule diretamente para a próxima seção. Caso contrário, veja como instalá-lo com um único comando no Linux e no macOS.
No Windows, baixe o instalador do site oficial.
Após instalado, o daemon Ollama escuta na porta 11434.
#2. Baixar Phi-4
O Phi-4 está disponível no catálogo oficial do Ollama. A tag padrão baixa a quantização Q4_K_M, que oferece o equilíbrio recomendado.
O download tem aproximadamente 9 GB. Para escolher explicitamente outra quantização, especifique a tag.
#3. Primeiros testes: matemática, código, raciocínio
Inicie uma sessão interativa para verificar se o modelo está funcionando e testar seus pontos fortes.
Você deverá ver um prompt `>>>`. É nos exercícios lógicos e técnicos que o Phi-4 se destaca. Alguns prompts reveladores:
Phi-4 desenvolve o raciocínio passo a passo e chega ao resultado. Para código, trata com facilidade Python e JavaScript padrão.
#4. Qualidade em francês: os verdadeiros pontos fracos
É aqui que o Phi-4 mostra suas limitações. O modelo foi treinado majoritariamente com conteúdo em inglês (e muitos dados sintéticos gerados em inglês). O francês está presente no corpus, mas é claramente secundário.
- Gramática e concordância
- Bons em frases simples, mas com erros de concordância, anglicismos e construções pesadas assim que se pede a redação de textos longos.
- Termos técnicos FR
- Tendência a usar termos em inglês ("endpoint", "deployment", "thread") mesmo quando existe um equivalente comum em francês.
- Compreensão
- Entende muito bem um prompt em francês. O problema é a geração.
- Código comentado em FR
- Os comentários de código mudam frequentemente para inglês durante a geração. Dê a instrução explicitamente; isso ajuda, mas não resolve tudo.
- Cultura FR
- Baixo. Conhecimento superficial da jurisprudência, da história ou das instituições francesas. Está longe de ser um modelo adequado para redigir uma nota jurídica em francês.
Uma dica que ajuda um pouco: um prompt de sistema rigoroso força o modelo a continuar respondendo em francês, ao custo de respostas às vezes mais curtas.
#5. Phi-4-Mini: a versão 3.8B
A Microsoft lançou paralelamente Phi-4-Mini, uma variante de 3,8B destinada a configurações muito restritas: laptops sem GPU dedicada, Raspberry Pi 5, dispositivos de borda. Com 2,5 GB em Q4, ela roda em qualquer máquina moderna.
- VRAM/RAM necessária
- ≈ 2,5 GB em Q4_K_M. Pode ser executado em um MacBook Air M1 com 8 GB ou em um PC com GPU de 4 GB.
- Velocidade
- Muito rápido. 80+ tok/s na RTX 3060, 30+ tok/s em CPU recente.
- Pontos fortes
- Segue bem instruções curtas, é adequado para ajudar com prompts, reformulações simples e classificação.
- Fraquezas
- Raciocínio complexo e código longo estão além de suas capacidades. Trata-se de um modelo de apoio, não um substituto da versão 14B.
#6. Phi-4 vs Qwen 3.5 9B
Em 2026, o concorrente direto mais relevante é o Qwen 3.5 9B da Alibaba. Um pouco mais compacto (6,6 GB em Q4 contra 9 GB para o Phi-4), ele cabe na mesma GPU de 12 GB e visa o mesmo público-alvo. O que os diferencia:
- Raciocínio e matemática
- Phi-4 leva vantagem nos benchmarks formais (GPQA, MATH). No uso prático em problemas comuns, a diferença é menor do que se imagina.
- Código
- Qwen 3.5 9B é, de modo geral, melhor em linguagens menos comuns (Rust, Go, SQL avançado). Phi-4 continua competitivo em Python e JS.
- Francês
- Qwen 3.5 é claramente melhor. Muito mais dados multilíngues no treinamento, vocabulário mais rico, menos mudanças para o inglês. Vantagem clara do Qwen nesse critério.
- Contexto
- Qwen 3.5 9B aceita até 256k tokens de contexto; Phi-4 tem um limite de 16k. Se você trabalha com documentos longos, Qwen é muito mais adequado.
- Capacidade de seguir instruções
- Phi-4 segue com mais precisão as instruções estruturadas (formato JSON, restrições rígidas). Qwen é um pouco mais "criativo" e pode tomar liberdades.
#Solução de problemas
- "Out of memory" ao carregar
- A sua VRAM não é suficiente para a quantização escolhida. Mude para Q4_K_M (a opção mais leve que ainda é útil) ou deixe o Ollama fazer o offload parcial para a CPU com `ollama run phi4 --num-gpu N`, onde N é o número de camadas a colocar na GPU.
- Geração a 1–2 token/s em uma máquina com GPU
- O modelo provavelmente está rodando na CPU. Use `ollama ps` para verificar a coluna "PROCESSOR". Se ela indicar 100% CPU, libere VRAM (Chrome, jogos, outros modelos carregados) e execute o modelo novamente.
- Respostas que mudam para inglês durante a geração
- Comportamento esperado do Phi-4 em francês. Reforçar o prompt de sistema ajuda parcialmente. Para uso recorrente em francês, mude de modelo em vez de insistir.
- Contexto truncado a 4096 tokens
- Ollama carrega por padrão um contexto curto. Amplie-o explicitamente: `/set parameter num_ctx 16384`. Quanto a ir além, o Phi-4 foi treinado apenas até 16k — não adianta aumentar mais.
- O modelo inventa fatos recentes
- O Phi-4 tem seu conhecimento congelado na data de treinamento (fim de 2024) e um conhecimento geral menos amplo que o de modelos maiores. Para informações factuais atualizadas, é necessário um pipeline RAG, não apenas o modelo.
#Para se aprofundar
Phi-4 é um bom ponto de entrada para LLMs de 14B em ambiente local. Algumas dicas para avançar com sua instalação:
- Testar um concorrente direto
- O guia de testes do Qwen 3 apresenta benchmarks comparáveis em hardware de uso comum, úteis para fazer a comparação usando seus próprios prompts.
- Escolher a quantização certa
- O guia "Escolher a quantização (Q4, Q5, Q8, FP16)" detalha os compromissos entre qualidade e memória que também se aplicam ao Phi-4.
- Rodar Phi-4 sem GPU
- Se você estiver usando apenas CPU, o guia "Executar um LLM localmente sem GPU" complementa o que está descrito aqui com otimizações específicas.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.