Modelos LLM locais no iPhone e no iPad: apps e modelos que rodam vraiment
Executar um LLM localmente no iPhone é possível e realmente funciona: os chips Apple Silicon (séries A e M) e o framework MLX permitem executar modelos de 1 a 8 bilhões de parâmetros off-line, diretamente no dispositivo. Este guia separa os aplicativos que cumprem suas promessas, explica o que a RAM realmente muda dependendo do seu iPhone ou iPad e apresenta referências reais de desempenho — sem marketing.
#Por que rodar um LLM local no iPhone
Um LLM local no iOS executa todo o cálculo no seu dispositivo: nenhum servidor, nenhuma assinatura, nenhum dado sai do telefone. É o oposto de um app como ChatGPT, que envia cada mensagem para a nuvem. As razões para querer isso são concretas: privacidade total (anotações médicas, rascunhos, código), funcionamento em avião ou sem rede e zero custo recorrente depois que o modelo é baixado.
A contrapartida é real: um iPhone não tem nem a memória nem a potência de um PC com uma RTX 4070. Não se pode rodar um modelo de 70B no bolso. Mas um modelo de 3B adequadamente quantizado é mais do que suficiente para resumir um texto, reescrever um e-mail, responder a perguntas simples ou traduzir — tudo fora de linha e instantaneamente acessível.
#Apple Silicon, MLX e Neural Engine
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Os iPhones e iPads modernos compartilham a arquitetura Apple Silicon com os Macs: um chip de sistema (série A no iPhone, série M no iPad Pro) e, principalmente, uma memória unificada compartilhada entre CPU, GPU e Neural Engine. É esse conjunto comum de RAM que torna a inferência de LLM possível em dispositivos móveis — o modelo é carregado uma vez e fica acessível a todos os núcleos sem cópia.
MLX é o framework de aprendizado de máquina da Apple, pensado para essa memória unificada. Os aplicativos sérios para iOS o utilizam (ou usam llama.cpp compilado com Metal) para aproveitar a GPU do chip. É nela que ocorre a maior parte do cálculo de inferência: na GPU via Metal, não apenas na CPU.
- Memória unificada
- CPU, GPU e ANE compartilham a mesma RAM. Isso é o fator limitante número 1 para o tamanho do modelo que você pode carregar.
- GPU Metal
- Executa a inferência via MLX ou llama.cpp. Isso determina seus tokens por segundo.
- Neural Engine (ANE)
- Poderoso, mas especializado. Pouco utilizado até hoje para geração de texto por LLMs.
#Pré-requisitos e RAM por dispositivo
No iOS, a RAM é o único número que realmente importa, e a Apple não a destaca. No entanto, é ela que determina se um modelo será carregado ou fará o aplicativo encerrar inesperadamente. Veja os valores de referência para os dispositivos recentes.
- iPhone 15 / 15 Plus
- 6 GB de RAM. Confortável para modelos de 1B a 3B em Q4. Um modelo de 3B roda; um de 7B está no limite e deixa pouca margem para o sistema.
- iPhone 15 Pro / 16 / 16 Pro
- 8 GB. O ponto ideal para dispositivos móveis: 3B roda com fluidez, 7B–8B é viável em Q4 com contexto moderado.
- iPhone 17 Pro
- 12 GB (linha Pro recente). Margem real para executar confortavelmente um modelo 7B–8B e usar contextos mais longos.
- iPad Pro M4
- 16 GB ou mais, conforme a configuração. A melhor opção para iOS: um modelo de 8B roda com fluidez, e modelos maiores passam a ser uma possibilidade.
As ordens de grandeza da memória necessária para um modelo quantizado em Q4 são as mesmas que em um computador desktop: um 3B pesa cerca de 2 GB, um 7B cerca de 5 GB, e um 8B um pouco mais. Adicione a memória do contexto (cache KV), que cresce à medida que a conversa fica mais longa. É por isso que um contexto longo pode fazer um aplicativo que iniciava normalmente parar de funcionar.
#Aplicativos iOS que funcionam
A App Store está repleta de apps de “IA” que são apenas interfaces para a nuvem. Para uma execução realmente local, é preciso um app que baixe o modelo no dispositivo e o execute com MLX ou llama.cpp. Aqui estão as opções confiáveis.
- PocketPal AI
- Gratuita e open source. Baixa modelos GGUF do Hugging Face e os executa via llama.cpp. Interface de chat simples, configurações de contexto e temperatura. O ponto de partida recomendado.
- LLM Farm
- De código aberto, muito configurável. Suporta diversos formatos e permite ajustes finos na inferência. Mais técnico, ideal para testar diferentes modelos.
- Enclave / aplicativos baseados em MLX
- Aplicativos baseados em MLX, o framework da Apple. Bom desempenho em chips Apple Silicon recentes, frequentemente voltados à privacidade.
- Private LLM
- App paga, oferece modelos quantizados otimizados e uma experiência pronta para usar. Não há configuração a fazer, tudo já vem integrado.
#Instalar e iniciar um modelo: passo a passo
O exemplo abaixo utiliza o PocketPal AI, gratuito e representativo do fluxo geral. A lógica é a mesma nas outras aplicações.
- 01Instalar o appBaixe o PocketPal AI na App Store. Nenhuma conta é necessária, e não há conexão com um servidor.
- 02Escolher um modeloAbra a biblioteca de modelos integrada. O app oferece modelos adaptados para dispositivos móveis (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Comece pequeno: um 2B ou 3B em Q4.
- 03BaixarInicie o download (algumas centenas de MB a ~2 GB de acordo com o tamanho). Faça isso via Wi-Fi. O arquivo permanece armazenado localmente no dispositivo.
- 04Carregar o modeloSelecione o modelo baixado para carregar na memória. Se o aplicativo fechar aqui, é falta de RAM: escolha um menor ou feche outros aplicativos.
- 05Conversar offlineAbra um chat e faça uma pergunta. Ative o modo avião para verificar: tudo continua funcionando, a prova de que nada sai do aparelho.
Para os curiosos que querem o caminho mais básico, também é possível compilar o llama.cpp por conta própria, mas o iOS não permite executar código arbitrário fora de um aplicativo assinado: na prática, usar um aplicativo dedicado é a única opção realista para a grande maioria dos usuários.
#Quais modelos escolher de acordo com a RAM
O modelo adequado depende principalmente do seu dispositivo. Aqui estão recomendações concretas, do mais simples ao mais potente, todos com quantização Q4.
- iPhone 15 / 15 Plus (6 GB)
- Qwen 3.5 2B (1,9 GB) ou Granite 4.2 3B (2,2 GB) para fluidez; Qwen 3.5 4B (3,4 GB) para maior qualidade. Mantenha contextos curtos.
- iPhone 16 / 16 Pro (8 GB)
- Um modelo de 3B–4B para uso diário fluido. Um modelo de 8B–9B (Granite 4.2 8B com 5,3 GB, Qwen 3.5 9B com 6,6 GB, contexto de 256k e visão) roda em Q4 com contexto moderado — mais lento, mas claramente mais capaz.
- iPhone 17 Pro (12 GB)
- 8B–9B confortável, contextos mais longos e Qwen 3.5 9B em Q8 (11 GB) para a qualidade máxima da faixa.
- iPad Pro M4 (16 GB+)
- Qwen 3.5 9B funciona de forma fluida no uso real; modelos de até ~12B (Gemma 4 12B, multimodal, 7,6 GB) podem ser testados, com uma velocidade que continua razoável graças à GPU M4.
Em francês, o Gemma 4 e os modelos Qwen 3.5 se saem bem para seu tamanho. Para resumos, reformulação e respostas curtas, um modelo de 3B é suficiente. Para raciocínio ou programação mais exigentes, as limitações do dispositivo móvel aparecem rapidamente — é hora de passar para uma máquina em casa.
#Confidencialidade total: nada sai do aparelho
Esse é o grande trunfo da execução local no celular. Depois que o modelo é baixado, nenhuma requisição de rede é necessária para conversar. Seus prompts, seus documentos e seus rascunhos ficam no iPhone. Nenhuma telemetria das conversas, nenhum treinamento com seus dados, nenhum risco de vazamento no servidor.
- Verifique no modo avião
- O teste mais simples: desligue toda a rede e verifique se o chat continua funcionando. Se funcionar offline, nada é transmitido.
- Cuidado com aplicações híbridas
- Alguns apps de “IA” mudam silenciosamente para a nuvem quando o modelo local falha. Prefira apps 100% locais e open source para eliminar dúvidas.
- Dados sensíveis
- Anotações de saúde, documentos profissionais sob NDA, informações pessoais: a execução local é a única forma de ter certeza de que esses conteúdos nunca saiam do seu dispositivo.
#Solução de problemas e dicas
- O app trava ao carregar o modelo
- Falta de RAM. Feche todas as outras aplicações, escolha um modelo menor (3B ao invés de 7B) ou uma quantização mais leve (Q4 ao invés de Q5/Q8).
- Respostas muito lentas
- Reduza o comprimento do contexto e o número de tokens gerados. Verifique também a temperatura: um iPhone quente reduz a velocidade e atrasa a inferência.
- O iPhone esquenta e a bateria se esgota rapidamente
- A inferência utiliza a GPU ao máximo. Isso é normal em sessões longas. Faça pausas, evite gerar continuamente e mantenha o aparelho conectado à energia durante o uso intensivo.
- O modelo dá respostas fora do assunto
- Normal para um modelo muito pequeno em uma tarefa complexa. Simplifique a solicitação ou passe para um modelo do tamanho seguinte, se sua RAM permitir.
- Download bloqueado
- Os arquivos GGUF são volumosos. Mantenha-se conectado ao Wi-Fi e evite colocar o app em segundo plano durante o download.
#Para se aprofundar
O dispositivo móvel é perfeito para uso em qualquer lugar e com privacidade, mas para tarefas pesadas você vai querer uma máquina de verdade. Esses guias do site complementam este:
- Executar um LLM localmente no Android
- O equivalente no Android: PocketPal, MLC Chat e llama.cpp via Termux, com as mesmas restrições de RAM.
- Instalar Ollama no macOS (Apple Silicon)
- Para passar do celular para o Mac: a memória unificada M1/M2/M3/M4 vai muito além, até os modelos de 32B e além.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Entender por que Q4_K_M é o equilíbrio recomendado tanto em dispositivos móveis quanto em PCs, e quando passar para Q5/Q8.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.