Iniciante 8 minOllama

Phi-4 localmente: instalar com Ollama, VRAM e velocidade

Phi-4 é o pequeno modelo da Microsoft que causou muita repercussão no final de 2024: apenas 14 bilhões de parâmetros, mas com pontuações em matemática e programação que rivalizam com as de modelos três vezes maiores. Este guia mostra como instalar o Phi-4 localmente com Ollama, o que ele realmente oferece na prática e onde decepciona — especialmente em francês.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux
i
Em resumo
Phi-4 é um modelo da Microsoft com 14 bilhões de parâmetros, forte em matemática e em código (GPQA, MATH, HumanEval), sob licença MIT. · Ele cabe em cerca de 9 GB de VRAM em Q4_K_M, sendo acessível a partir de uma RTX 3060 ou RTX 4070 de 12 GB, ou até usando apenas a CPU (16 GB de RAM, cerca de 5 tok/s). · A instalação é feita com apenas um comando: ollama pull phi4. · Sua fraqueza: o francês, com erros de concordância e mudanças para o inglês — prefira Mistral Small ou Qwen 3.5 9B para redação em francês.

#Por que Phi-4?

Phi-4 é a sequência lógica da família Phi da Microsoft Research: modelos de pequeno porte, treinados principalmente com dados sintéticos cuidadosamente elaborados, pensados para competir com modelos muito maiores em tarefas de raciocínio. A versão 4, lançada no final de 2024, expande essa abordagem para 14B de parâmetros e alcança resultados notáveis em GPQA, MATH e HumanEval — muitas vezes acima de Llama 3.3 70B nesses benchmarks específicos.

Na prática, é um modelo que cabe em 9 GB de VRAM em Q4_K_M, portanto acessível a uma GPU de entrada com 12 GB, como uma RTX 3060 ou uma RTX 4070. E ele se sai razoavelmente bem mesmo usando apenas a CPU, desde que você tenha 16 GB de RAM. É esse equilíbrio entre tamanho e qualidade que o torna um excelente candidato para auto-hospedagem com recursos modestos.

i
Em resumo
Phi-4 = 14B, forte em matemática e em código, fraco em cultura geral e em francês, licença MIT. Ideal se você quer um "pequeno gigante" para tarefas técnicas em uma GPU de 12 GB.

#Pré-requisitos

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
Ollama instalado
Windows, macOS ou Linux. Se você ainda não instalou o Ollama, seguir o guia de instalação leva 3 minutos.
VRAM para a quantização Q4_K_M
≈ 9 GB. Uma RTX 3060 de 12 GB, uma RTX 4070 de 12 GB ou um Mac com 16 GB de memória unificada passam sem problemas.
RAM do CPU se não houver GPU
No mínimo 16 GB para Q4. Espere de 4 a 8 tokens/s em um Ryzen 5 ou Core i5 recente — utilizável para testes, mas não para um chat fluido.
10 GB de espaço em disco
O modelo Q4_K_M pesa aproximadamente 9 GB. Reserve mais se quiser também testar o Phi-4-Mini em paralelo.
→
Caso CPU-only
Phi-4 é um dos poucos 14B realmente utilizáveis sem GPU. Em um Ryzen 7 5800X ou um Intel i7-12700, atingimos cerca de 5 tok/s em Q4 — lento, mas aceitável para uma pergunta de cada vez. Para uso interativo, ainda assim, procure um GPU.

#1. Instalar o Ollama

Se o Ollama já está instalado, pule diretamente para a próxima seção. Caso contrário, veja como instalá-lo com um único comando no Linux e no macOS.

Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

No Windows, baixe o instalador do site oficial.

Link oficial para Windows
https://ollama.com/download/windows

Após instalado, o daemon Ollama escuta na porta 11434.

Verificação
ollama --version
curl http://localhost:11434/api/tags

#2. Baixar Phi-4

O Phi-4 está disponível no catálogo oficial do Ollama. A tag padrão baixa a quantização Q4_K_M, que oferece o equilíbrio recomendado.

Terminal
ollama pull phi4

O download tem aproximadamente 9 GB. Para escolher explicitamente outra quantização, especifique a tag.

Variantes
ollama pull phi4:14b-q4_K_M    # ≈ 9 Go  (défaut)
ollama pull phi4:14b-q5_K_M    # ≈ 10 Go
ollama pull phi4:14b-q8_0      # ≈ 15 Go
ollama pull phi4:14b-fp16      # ≈ 29 Go (sans quantization)
→
Qual quantização escolher
Para Phi-4, Q4_K_M continua sendo o melhor equilíbrio em hardware comum. A diferença em relação ao Q5_K_M é marginal na prática nesse modelo, e o Q8_0 exige 15 GB de VRAM para um ganho qualitativo difícil de perceber fora dos benchmarks.

#3. Primeiros testes: matemática, código, raciocínio

Inicie uma sessão interativa para verificar se o modelo está funcionando e testar seus pontos fortes.

Sessão
ollama run phi4

Você deverá ver um prompt `>>>`. É nos exercícios lógicos e técnicos que o Phi-4 se destaca. Alguns prompts reveladores:

Teste de matemática
>>> Une boutique vend des stylos à 0,80 € pièce. Si vous en achetez 12 ou plus, le prix tombe à 0,65 € pièce. À partir de combien de stylos est-il plus économique de commander une boîte de 12 ?

Phi-4 desenvolve o raciocínio passo a passo e chega ao resultado. Para código, trata com facilidade Python e JavaScript padrão.

Código de teste
>>> Écris une fonction Python qui prend une liste d'entiers et renvoie le sous-tableau contigu de somme maximale (algorithme de Kadane). Avec docstring et 3 cas de test.
i
Velocidade estimada
Em uma RTX 4070 (12 GB), em Q4_K_M, conte com 45–60 tok/sec. Em uma RTX 3060 (12 GB), 25–35 tok/sec. Em um Mac M2 com 24 GB, 20–30 tok/sec. Em uma CPU Ryzen 5 5600X, 4–6 tok/sec.

#4. Qualidade em francês: os verdadeiros pontos fracos

É aqui que o Phi-4 mostra suas limitações. O modelo foi treinado majoritariamente com conteúdo em inglês (e muitos dados sintéticos gerados em inglês). O francês está presente no corpus, mas é claramente secundário.

Gramática e concordância
Bons em frases simples, mas com erros de concordância, anglicismos e construções pesadas assim que se pede a redação de textos longos.
Termos técnicos FR
Tendência a usar termos em inglês ("endpoint", "deployment", "thread") mesmo quando existe um equivalente comum em francês.
Compreensão
Entende muito bem um prompt em francês. O problema é a geração.
Código comentado em FR
Os comentários de código mudam frequentemente para inglês durante a geração. Dê a instrução explicitamente; isso ajuda, mas não resolve tudo.
Cultura FR
Baixo. Conhecimento superficial da jurisprudência, da história ou das instituições francesas. Está longe de ser um modelo adequado para redigir uma nota jurídica em francês.
!
O veredicto para o uso em francês
Para escrever textos de qualidade adequada em francês, prefira Mistral Small 24B (generalista, bom em francês) ou, em uma máquina mais modesta, Qwen 3.5 9B — muito mais à vontade em francês do que Phi-4. Phi-4 continua excelente para tarefas em que a saída é código ou raciocínio estruturado — e em que o idioma da interação importa pouco.

Uma dica que ajuda um pouco: um prompt de sistema rigoroso força o modelo a continuar respondendo em francês, ao custo de respostas às vezes mais curtas.

Prompt de sistema FR
>>> /set system "Tu réponds exclusivement en français, sans jamais basculer en anglais. Les commentaires de code, les noms de variables explicatifs et les titres restent en français."

#5. Phi-4-Mini: a versão 3.8B

A Microsoft lançou paralelamente Phi-4-Mini, uma variante de 3,8B destinada a configurações muito restritas: laptops sem GPU dedicada, Raspberry Pi 5, dispositivos de borda. Com 2,5 GB em Q4, ela roda em qualquer máquina moderna.

Instalação
ollama pull phi4-mini
VRAM/RAM necessária
≈ 2,5 GB em Q4_K_M. Pode ser executado em um MacBook Air M1 com 8 GB ou em um PC com GPU de 4 GB.
Velocidade
Muito rápido. 80+ tok/s na RTX 3060, 30+ tok/s em CPU recente.
Pontos fortes
Segue bem instruções curtas, é adequado para ajudar com prompts, reformulações simples e classificação.
Fraquezas
Raciocínio complexo e código longo estão além de suas capacidades. Trata-se de um modelo de apoio, não um substituto da versão 14B.
→
Casos de uso do Phi-4-Mini
Excelente para integrar a um workflow n8n local, classificar e-mails ou integrar um LLM a um script Python que precise rodar rápido e consumir poucos recursos. Não recomendado para conversas de uso geral.

#6. Phi-4 vs Qwen 3.5 9B

Em 2026, o concorrente direto mais relevante é o Qwen 3.5 9B da Alibaba. Um pouco mais compacto (6,6 GB em Q4 contra 9 GB para o Phi-4), ele cabe na mesma GPU de 12 GB e visa o mesmo público-alvo. O que os diferencia:

Raciocínio e matemática
Phi-4 leva vantagem nos benchmarks formais (GPQA, MATH). No uso prático em problemas comuns, a diferença é menor do que se imagina.
Código
Qwen 3.5 9B é, de modo geral, melhor em linguagens menos comuns (Rust, Go, SQL avançado). Phi-4 continua competitivo em Python e JS.
Francês
Qwen 3.5 é claramente melhor. Muito mais dados multilíngues no treinamento, vocabulário mais rico, menos mudanças para o inglês. Vantagem clara do Qwen nesse critério.
Contexto
Qwen 3.5 9B aceita até 256k tokens de contexto; Phi-4 tem um limite de 16k. Se você trabalha com documentos longos, Qwen é muito mais adequado.
Capacidade de seguir instruções
Phi-4 segue com mais precisão as instruções estruturadas (formato JSON, restrições rígidas). Qwen é um pouco mais "criativo" e pode tomar liberdades.
→
Como escolher
Trabalho em inglês com raciocínio, código Python e saída estruturada: Phi-4. Trabalho em francês, contexto longo, código em várias linguagens: Qwen 3.5 9B. Com uma GPU de 12 GB, você pode, de qualquer forma, instalar os dois e alternar conforme a tarefa.

#Solução de problemas

"Out of memory" ao carregar
A sua VRAM não é suficiente para a quantização escolhida. Mude para Q4_K_M (a opção mais leve que ainda é útil) ou deixe o Ollama fazer o offload parcial para a CPU com `ollama run phi4 --num-gpu N`, onde N é o número de camadas a colocar na GPU.
Geração a 1–2 token/s em uma máquina com GPU
O modelo provavelmente está rodando na CPU. Use `ollama ps` para verificar a coluna "PROCESSOR". Se ela indicar 100% CPU, libere VRAM (Chrome, jogos, outros modelos carregados) e execute o modelo novamente.
Respostas que mudam para inglês durante a geração
Comportamento esperado do Phi-4 em francês. Reforçar o prompt de sistema ajuda parcialmente. Para uso recorrente em francês, mude de modelo em vez de insistir.
Contexto truncado a 4096 tokens
Ollama carrega por padrão um contexto curto. Amplie-o explicitamente: `/set parameter num_ctx 16384`. Quanto a ir além, o Phi-4 foi treinado apenas até 16k — não adianta aumentar mais.
O modelo inventa fatos recentes
O Phi-4 tem seu conhecimento congelado na data de treinamento (fim de 2024) e um conhecimento geral menos amplo que o de modelos maiores. Para informações factuais atualizadas, é necessário um pipeline RAG, não apenas o modelo.

#Para se aprofundar

Phi-4 é um bom ponto de entrada para LLMs de 14B em ambiente local. Algumas dicas para avançar com sua instalação:

Testar um concorrente direto
O guia de testes do Qwen 3 apresenta benchmarks comparáveis em hardware de uso comum, úteis para fazer a comparação usando seus próprios prompts.
Escolher a quantização certa
O guia "Escolher a quantização (Q4, Q5, Q8, FP16)" detalha os compromissos entre qualidade e memória que também se aplicam ao Phi-4.
Rodar Phi-4 sem GPU
Se você estiver usando apenas CPU, o guia "Executar um LLM localmente sem GPU" complementa o que está descrito aqui com otimizações específicas.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.