Iniciante 10 minMóvel

Modelos LLM locais no iPhone e no iPad: apps e modelos que rodam vraiment

Executar um LLM localmente no iPhone é possível e realmente funciona: os chips Apple Silicon (séries A e M) e o framework MLX permitem executar modelos de 1 a 8 bilhões de parâmetros off-line, diretamente no dispositivo. Este guia separa os aplicativos que cumprem suas promessas, explica o que a RAM realmente muda dependendo do seu iPhone ou iPad e apresenta referências reais de desempenho — sem marketing.

Por Clara M.·Atualização 2026-08-27·Testado no macOS 14+

#Por que rodar um LLM local no iPhone

Um LLM local no iOS executa todo o cálculo no seu dispositivo: nenhum servidor, nenhuma assinatura, nenhum dado sai do telefone. É o oposto de um app como ChatGPT, que envia cada mensagem para a nuvem. As razões para querer isso são concretas: privacidade total (anotações médicas, rascunhos, código), funcionamento em avião ou sem rede e zero custo recorrente depois que o modelo é baixado.

A contrapartida é real: um iPhone não tem nem a memória nem a potência de um PC com uma RTX 4070. Não se pode rodar um modelo de 70B no bolso. Mas um modelo de 3B adequadamente quantizado é mais do que suficiente para resumir um texto, reescrever um e-mail, responder a perguntas simples ou traduzir — tudo fora de linha e instantaneamente acessível.

i
O que é realista em dispositivos móveis
Opte por modelos de 1B a 8B com quantização Q4. Abaixo de 1B, a qualidade despenca; acima de 8B, apenas os iPad Pro e os iPhones topo de linha recentes dão conta, e ainda assim lentamente.

#Apple Silicon, MLX e Neural Engine

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Os iPhones e iPads modernos compartilham a arquitetura Apple Silicon com os Macs: um chip de sistema (série A no iPhone, série M no iPad Pro) e, principalmente, uma memória unificada compartilhada entre CPU, GPU e Neural Engine. É esse conjunto comum de RAM que torna a inferência de LLM possível em dispositivos móveis — o modelo é carregado uma vez e fica acessível a todos os núcleos sem cópia.

MLX é o framework de aprendizado de máquina da Apple, pensado para essa memória unificada. Os aplicativos sérios para iOS o utilizam (ou usam llama.cpp compilado com Metal) para aproveitar a GPU do chip. É nela que ocorre a maior parte do cálculo de inferência: na GPU via Metal, não apenas na CPU.

!
O que a Neural Engine não faz (ainda)
Muitas pessoas acreditam que a Neural Engine (ANE) acelera os LLM. Na prática, a geração de texto token por token hoje passa principalmente pela GPU, usando Metal via MLX ou llama.cpp. A ANE se destaca em modelos com grafo fixo (visão, Face ID), mas menos na geração autorregressiva. Não conte com ela para aumentar sua taxa de tokens por segundo.
Memória unificada
CPU, GPU e ANE compartilham a mesma RAM. Isso é o fator limitante número 1 para o tamanho do modelo que você pode carregar.
GPU Metal
Executa a inferência via MLX ou llama.cpp. Isso determina seus tokens por segundo.
Neural Engine (ANE)
Poderoso, mas especializado. Pouco utilizado até hoje para geração de texto por LLMs.

#Pré-requisitos e RAM por dispositivo

No iOS, a RAM é o único número que realmente importa, e a Apple não a destaca. No entanto, é ela que determina se um modelo será carregado ou fará o aplicativo encerrar inesperadamente. Veja os valores de referência para os dispositivos recentes.

iPhone 15 / 15 Plus
6 GB de RAM. Confortável para modelos de 1B a 3B em Q4. Um modelo de 3B roda; um de 7B está no limite e deixa pouca margem para o sistema.
iPhone 15 Pro / 16 / 16 Pro
8 GB. O ponto ideal para dispositivos móveis: 3B roda com fluidez, 7B–8B é viável em Q4 com contexto moderado.
iPhone 17 Pro
12 GB (linha Pro recente). Margem real para executar confortavelmente um modelo 7B–8B e usar contextos mais longos.
iPad Pro M4
16 GB ou mais, conforme a configuração. A melhor opção para iOS: um modelo de 8B roda com fluidez, e modelos maiores passam a ser uma possibilidade.
→
Regra prática para a memória
O iOS não permite que um app monopolize toda a RAM. Considere que um app de terceiros dispõe, grosso modo, de metade a dois terços da RAM física. Em um iPhone com 8 GB de RAM, preveja um orçamento de memória realista para o modelo em torno de 4–5 GB — ou seja, um 7B em Q4 com pouca folga, ou um 3B com muita folga.

As ordens de grandeza da memória necessária para um modelo quantizado em Q4 são as mesmas que em um computador desktop: um 3B pesa cerca de 2 GB, um 7B cerca de 5 GB, e um 8B um pouco mais. Adicione a memória do contexto (cache KV), que cresce à medida que a conversa fica mais longa. É por isso que um contexto longo pode fazer um aplicativo que iniciava normalmente parar de funcionar.

#Aplicativos iOS que funcionam

A App Store está repleta de apps de “IA” que são apenas interfaces para a nuvem. Para uma execução realmente local, é preciso um app que baixe o modelo no dispositivo e o execute com MLX ou llama.cpp. Aqui estão as opções confiáveis.

PocketPal AI
Gratuita e open source. Baixa modelos GGUF do Hugging Face e os executa via llama.cpp. Interface de chat simples, configurações de contexto e temperatura. O ponto de partida recomendado.
LLM Farm
De código aberto, muito configurável. Suporta diversos formatos e permite ajustes finos na inferência. Mais técnico, ideal para testar diferentes modelos.
Enclave / aplicativos baseados em MLX
Aplicativos baseados em MLX, o framework da Apple. Bom desempenho em chips Apple Silicon recentes, frequentemente voltados à privacidade.
Private LLM
App paga, oferece modelos quantizados otimizados e uma experiência pronta para usar. Não há configuração a fazer, tudo já vem integrado.
i
GGUF, o formato de arquivo dos modelos
A maioria dessas aplicações carrega arquivos GGUF — o formato do llama.cpp. Você escolhe a quantização no momento do download: Q4_K_M é o melhor equilíbrio entre tamanho e qualidade, exatamente como no PC. Evite o FP16 em dispositivos móveis: ele é pesado demais.

#Instalar e iniciar um modelo: passo a passo

O exemplo abaixo utiliza o PocketPal AI, gratuito e representativo do fluxo geral. A lógica é a mesma nas outras aplicações.

  1. 01
    Instalar o app
    Baixe o PocketPal AI na App Store. Nenhuma conta é necessária, e não há conexão com um servidor.
  2. 02
    Escolher um modelo
    Abra a biblioteca de modelos integrada. O app oferece modelos adaptados para dispositivos móveis (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Comece pequeno: um 2B ou 3B em Q4.
  3. 03
    Baixar
    Inicie o download (algumas centenas de MB a ~2 GB de acordo com o tamanho). Faça isso via Wi-Fi. O arquivo permanece armazenado localmente no dispositivo.
  4. 04
    Carregar o modelo
    Selecione o modelo baixado para carregar na memória. Se o aplicativo fechar aqui, é falta de RAM: escolha um menor ou feche outros aplicativos.
  5. 05
    Conversar offline
    Abra um chat e faça uma pergunta. Ative o modo avião para verificar: tudo continua funcionando, a prova de que nada sai do aparelho.

Para os curiosos que querem o caminho mais básico, também é possível compilar o llama.cpp por conta própria, mas o iOS não permite executar código arbitrário fora de um aplicativo assinado: na prática, usar um aplicativo dedicado é a única opção realista para a grande maioria dos usuários.

#Quais modelos escolher de acordo com a RAM

O modelo adequado depende principalmente do seu dispositivo. Aqui estão recomendações concretas, do mais simples ao mais potente, todos com quantização Q4.

iPhone 15 / 15 Plus (6 GB)
Qwen 3.5 2B (1,9 GB) ou Granite 4.2 3B (2,2 GB) para fluidez; Qwen 3.5 4B (3,4 GB) para maior qualidade. Mantenha contextos curtos.
iPhone 16 / 16 Pro (8 GB)
Um modelo de 3B–4B para uso diário fluido. Um modelo de 8B–9B (Granite 4.2 8B com 5,3 GB, Qwen 3.5 9B com 6,6 GB, contexto de 256k e visão) roda em Q4 com contexto moderado — mais lento, mas claramente mais capaz.
iPhone 17 Pro (12 GB)
8B–9B confortável, contextos mais longos e Qwen 3.5 9B em Q8 (11 GB) para a qualidade máxima da faixa.
iPad Pro M4 (16 GB+)
Qwen 3.5 9B funciona de forma fluida no uso real; modelos de até ~12B (Gemma 4 12B, multimodal, 7,6 GB) podem ser testados, com uma velocidade que continua razoável graças à GPU M4.
→
Pequeno e recente supera grande e antigo
Um modelo 3B recente (Granite 4.2 3B, Qwen 3.5 2B/4B, Gemma 4 E2B) geralmente responde melhor que um 7B mais antigo, consumindo metade da RAM. Em dispositivos móveis, dê prioridade à geração do modelo em vez de ao tamanho bruto.

Em francês, o Gemma 4 e os modelos Qwen 3.5 se saem bem para seu tamanho. Para resumos, reformulação e respostas curtas, um modelo de 3B é suficiente. Para raciocínio ou programação mais exigentes, as limitações do dispositivo móvel aparecem rapidamente — é hora de passar para uma máquina em casa.

#Confidencialidade total: nada sai do aparelho

Esse é o grande trunfo da execução local no celular. Depois que o modelo é baixado, nenhuma requisição de rede é necessária para conversar. Seus prompts, seus documentos e seus rascunhos ficam no iPhone. Nenhuma telemetria das conversas, nenhum treinamento com seus dados, nenhum risco de vazamento no servidor.

Verifique no modo avião
O teste mais simples: desligue toda a rede e verifique se o chat continua funcionando. Se funcionar offline, nada é transmitido.
Cuidado com aplicações híbridas
Alguns apps de “IA” mudam silenciosamente para a nuvem quando o modelo local falha. Prefira apps 100% locais e open source para eliminar dúvidas.
Dados sensíveis
Anotações de saúde, documentos profissionais sob NDA, informações pessoais: a execução local é a única forma de ter certeza de que esses conteúdos nunca saiam do seu dispositivo.
i
Local não significa infalível
O modelo não vaza seus dados, mas pode errar (alucinações). Para decisões importantes, mantenha uma postura crítica — a confidencialidade não é a mesma coisa que a confiabilidade.

#Solução de problemas e dicas

O app trava ao carregar o modelo
Falta de RAM. Feche todas as outras aplicações, escolha um modelo menor (3B ao invés de 7B) ou uma quantização mais leve (Q4 ao invés de Q5/Q8).
Respostas muito lentas
Reduza o comprimento do contexto e o número de tokens gerados. Verifique também a temperatura: um iPhone quente reduz a velocidade e atrasa a inferência.
O iPhone esquenta e a bateria se esgota rapidamente
A inferência utiliza a GPU ao máximo. Isso é normal em sessões longas. Faça pausas, evite gerar continuamente e mantenha o aparelho conectado à energia durante o uso intensivo.
O modelo dá respostas fora do assunto
Normal para um modelo muito pequeno em uma tarefa complexa. Simplifique a solicitação ou passe para um modelo do tamanho seguinte, se sua RAM permitir.
Download bloqueado
Os arquivos GGUF são volumosos. Mantenha-se conectado ao Wi-Fi e evite colocar o app em segundo plano durante o download.

#Para se aprofundar

O dispositivo móvel é perfeito para uso em qualquer lugar e com privacidade, mas para tarefas pesadas você vai querer uma máquina de verdade. Esses guias do site complementam este:

Executar um LLM localmente no Android
O equivalente no Android: PocketPal, MLC Chat e llama.cpp via Termux, com as mesmas restrições de RAM.
Instalar Ollama no macOS (Apple Silicon)
Para passar do celular para o Mac: a memória unificada M1/M2/M3/M4 vai muito além, até os modelos de 32B e além.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Entender por que Q4_K_M é o equilíbrio recomendado tanto em dispositivos móveis quanto em PCs, e quando passar para Q5/Q8.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.