LLM em NVIDIA Jetson Orin: a IA embarcada que cabe na palma da main
O NVIDIA Jetson Orin é a placa que coloca uma GPU CUDA de verdade em um gabinete do tamanho de um baralho. Ao contrário de um Raspberry Pi, o Jetson Orin executa um LLM com aceleração de hardware, o que muda tudo para a IA embarcada: robótica, automação residencial, sensores autônomos. Este guia abrange a escolha da placa (Nano 8 GB ou AGX 64 GB), a instalação do JetPack, a implantação do Ollama e do llama.cpp e os modelos viáveis de acordo com a memória disponível — sempre com execução local.
Você está escolhendo uma máquina? Nossas escolhas por orçamento →
Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.
Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
Compare todas as opções por orçamento, de 800 a 3 500 € →
Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Em deslocamento: qual notebook para IA local →
Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.
#Por que um Jetson Orin para um LLM
Um Jetson Orin não é um microcontrolador: é um módulo system-on-chip que combina uma CPU ARM Cortex, uma GPU NVIDIA com núcleos CUDA e Tensor e memória unificada compartilhada entre os dois. Na prática, a GPU acessa diretamente a RAM do sistema — sem VRAM separada. Um LLM carregado ocupa, portanto, a memória unificada, exatamente como em um Mac Apple Silicon, e o cálculo aproveita a aceleração CUDA.
É isso que diferencia radicalmente um LLM no Jetson Orin de uma IA no Raspberry Pi: enquanto o Pi tem dificuldade usando apenas a CPU, o Orin delega o processamento à GPU e mantém velocidades utilizáveis em modelos de 3B a 8B. Tudo isso com um consumo de 7 a 60 watts, podendo funcionar com bateria, sem ventilador barulhento nem gabinete sob a mesa.
- Independência da rede
- Sem dependência da nuvem: o modelo roda no próprio equipamento, inclusive em um robô móvel ou em um local isolado sem conexão.
- Latência previsível
- Sem ida e volta de dados pela internet. A resposta depende apenas da GPU local, o que importa para um ciclo de controle em tempo real.
- Privacidade
- Os dados de sensores, câmeras ou microfones nunca saem do dispositivo. Fundamental em domótica e em ambientes médicos.
- Ecossistema CUDA
- A mesma pilha de software de uma GPU NVIDIA de desktop: Ollama, llama.cpp, PyTorch e TensorRT funcionam, com a ressalva de que é preciso compilar para ARM.
#Jetson Orin Nano ou AGX: escolher sua placa
Na linha Orin, a capacidade de memória varia por um fator de 8, e a capacidade de processamento varia ainda mais. Para um LLM, o critério decisivo é a RAM unificada: ela limita o tamanho do modelo exatamente como a VRAM em uma GPU tradicional. Estes são os níveis que importam.
- Orin Nano 8 GB
- A opção de entrada (~40 TOPS). 8 GB de RAM unificada compartilhada com o sistema. Voltada a modelos 3B em Q4, ou a um 7B com pouca folga de memória se você liberar espaço nela. Ideal para um sensor inteligente ou um assistente de voz embarcado.
- Orin NX 8 / 16 GB
- Faixa média (~70-100 TOPS). A versão de 16 GB permite rodar confortavelmente modelos 7B-8B em Q4_K_M. Bom compromisso para robótica móvel.
- AGX Orin 32 GB
- Estação embarcada (~200 TOPS). Executa um 14B em Q4 com contexto ou vários modelos pequenos em paralelo (visão + linguagem).
- AGX Orin 64 GB
- O modelo topo de linha (~275 TOPS). Voltado para modelos de 32B em Q4 (~19 GB), com margem para o contexto e outras cargas. O único da linha voltado para um uso efetivo de modelos de 32B.
#Pré-requisitos e função do JetPack
Todo o ecossistema Jetson se baseia no JetPack, a distribuição de software da NVIDIA. Ela inclui Ubuntu (L4T, Linux for Tegra), os drivers CUDA, cuDNN, TensorRT e as bibliotecas de GPU. Sem a imagem do JetPack corretamente gravada no dispositivo, não há aceleração: você acabaria usando apenas a CPU, perdendo toda a vantagem da placa.
- Uma placa Jetson Orin
- Nano, NX ou AGX, com a fonte de alimentação adequada (o Nano consome até 15 W e o AGX até 60 W).
- Armazenamento rápido
- Cartão microSD (UHS-I) para testar o Nano, mas um SSD NVMe é altamente recomendado: os modelos ocupam vários GB, e o carregamento é prejudicado ao usar um cartão SD.
- Um PC host com Linux (Ubuntu)
- Necessário para gravar o firmware nos AGX/NX via SDK Manager. O Nano Developer Kit pode ser instalado diretamente a partir de uma imagem de cartão SD.
- JetPack 6.x
- O ramo recente baseado no Ubuntu 22.04, com CUDA 12. É o alvo para uma stack moderna de LLM (Ollama e llama.cpp compilados para a arquitetura ARM SBSA).
#1. Fazer o flash do JetPack e verificar o CUDA
- 01Gravar a imagemPara um Orin Nano Developer Kit, grave a imagem SD oficial em um cartão com o Balena Etcher, insira o cartão, conecte o equipamento e siga o assistente do Ubuntu. Para um AGX/NX, use o NVIDIA SDK Manager no PC host, com um cabo USB-C e a placa em modo de recuperação.
- 02Atualizar o sistemaNa primeira inicialização, atualize os pacotes. Esse também é o momento de instalar os componentes JetPack que faltam, se você tiver usado a imagem SD.
- 03Verificar a GPU e o CUDAVerifique se o CUDA está presente e se o módulo é reconhecido. O jtop (instalado pelo pacote jetson-stats) fornece uma visão em tempo real da GPU, da RAM e do consumo — o equivalente ao nvidia-smi no Jetson.
#2. Instalar o Ollama no JetPack
Ollama é o caminho mais rápido para um primeiro modelo. O script de instalação oficial detecta a arquitetura ARM64 e a GPU Jetson e configura o serviço systemd. Uma vez iniciado, o daemon escuta por padrão em http://localhost:11434, exatamente como em um PC de mesa.
Para uma interface no estilo ChatGPT, adicione o Open WebUI em um contêiner apontando para o mesmo endpoint. Em um Nano de 8 GB, evite excessos: cada serviço consome memória unificada já contabilizada para o modelo.
#3. Compilar o llama.cpp com CUDA
O Ollama é suficiente para a maioria dos usos, mas compilar o llama.cpp manualmente oferece um controle preciso: escolha da quantização GGUF exata, ajuste do número de camadas transferidas para a GPU e, muitas vezes, alguns tokens por segundo a mais. Também é o caminho para integrar o motor ao seu próprio binário embarcado.
#Quais modelos rodam de acordo com a memória disponível
A regra é a mesma que em uma GPU de desktop: com quantização Q4_K_M (o melhor equilíbrio entre qualidade e memória), considere ~2 GB para um 3B, ~5 GB para um 7B, ~9 GB para um 14B e ~19 GB para um 32B. No Jetson, subtraia a memória do sistema da RAM total para saber quanta memória você realmente tem disponível.
- Orin Nano 8 GB
- Granite 4.2 3B (~2,2 GB), Qwen 3.5 4B (~3,4 GB) ou Gemma 4 E2B (~4,3 GB) em Q4. Um modelo 8B (Granite 4.2 8B, ~5,3 GB) cabe se você fechar todos os outros programas, mas a margem para o contexto continua pequena.
- Orin NX 16 GB
- Confortável nos modelos 8B–9B (Granite 4.2 8B, Qwen 3.5 9B) em Q4_K_M com contexto. Um 24B (Mistral Small 24B, ~14 GB) cabe em Q4, deixando pouca margem.
- AGX Orin 32 GB
- Um modelo de 24B (Mistral Small, gpt-oss 20B) com folga, ou um MoE de 30–35B (Qwen 3.6 35B-A3B, ~23 GB). Espaço suficiente para combinar um modelo de linguagem e uma pilha de visão computacional.
- AGX Orin 64 GB
- Um MoE de 30-35B em qualidade máxima, um 24B em Q8 ou vários modelos carregados simultaneamente. O único patamar que visa seriamente aos modelos grandes com folga.
#Consumo e modos de alimentação
O principal ponto forte do Jetson é o desempenho por watt. Cada placa oferece modos de alimentação (power modes) que limitam o consumo ativando mais ou menos núcleos da CPU e limitando a frequência da GPU. Esses modos são controlados com nvpmodel, e jetson_clocks força as frequências ao máximo permitido pelo modo.
- Modo de baixo consumo
- No Orin Nano, um modo de 7 W limita bastante a taxa de geração, mas permite alimentação por bateria ou por uma fonte USB-C de baixa potência. Adequado para um sensor que consulta o modelo de forma intermitente.
- Modo de potência máxima
- O modo MAXN libera todo o potencial da GPU. No AGX Orin, o consumo pode atingir 60 W: preveja a refrigeração (dissipador ativo) e uma fonte de alimentação devidamente dimensionada.
- O equilíbrio para sistemas embarcados
- Muitos projetos funcionam bem no modo de 15 a 25 W: boa taxa de geração com um modelo de 3B a 7B, dissipação de calor gerenciável e autonomia de bateria razoável.
#Casos de uso: robótica e automação residencial
O Jetson se destaca onde um LLM precisa operar o mais próximo possível do mundo físico, sem latência da nuvem nem vazamento de dados. Duas áreas dominam os sistemas embarcados.
- Robótica (ROS 2)
- O LLM atua como interface de linguagem natural: traduzir uma instrução falada em uma sequência de ações, descrever uma cena percebida pela câmera, raciocinar sobre uma tarefa. O Jetson hospeda ao mesmo tempo a percepção (visão) e a linguagem, na mesma GPU.
- Automação residencial local
- Um assistente de voz doméstico que controla o Home Assistant sem nunca passar por um serviço de nuvem. O modelo interpreta as solicitações em linguagem natural e aciona as automações — o microfone e os dados permanecem em casa.
- Sensor inteligente autônomo
- Em um local isolado (agrícola, industrial), o Orin analisa dados localmente e gera sínteses em linguagem natural, que são transmitidas somente quando há uma conexão disponível.
- Assistente de campo off-line
- Documentação técnica consultável em RAG, integrada a um veículo ou equipamento, funcionando sem rede.
#Em comparação com o Raspberry Pi: a diferença real
A pergunta sempre volta: por que comprar um Jetson quando um Raspberry Pi 5 também roda Ollama? A resposta cabe em uma palavra: GPU. O Pi não tem um acelerador utilizável para a inferência de LLMs; tudo é feito na CPU ARM. Já o Jetson transfere o cálculo para os núcleos CUDA.
- Aceleração
- Pi 5: apenas CPU, com dificuldade para gerar alguns tokens por segundo em um 3B. Jetson Orin: GPU CUDA, taxa de geração várias vezes maior no mesmo modelo e modelos de 7B a 14B realmente utilizáveis.
- Memória
- O Pi 5 é limitado a 8/16 GB de RAM para a CPU. O Jetson chega a 64 GB de memória unificada utilizável pela GPU, permitindo rodar modelos fora do alcance do Pi.
- Preço
- O Pi custa uma fração do preço do Jetson. A diferença de preço é real: o Jetson se justifica quando você precisa de maior taxa de processamento ou de modelos grandes, não para um simples bot de 1B.
- Ecossistema
- O Pi é generalista e comunitário; o Jetson visa a IA embarcada com CUDA, TensorRT e suporte da NVIDIA para robótica (Isaac).
#Solução de problemas
- Ollama continua rodando na CPU
- A GPU não é utilizada se JetPack/CUDA não estiver corretamente instalado ou se você tiver gravado uma imagem ARM genérica sem suporte a Tegra. Verifique nvcc --version e a atividade da GPU no jtop.
- Out of memory ao carregar
- O modelo excede a memória unificada disponível após descontar a memória usada pelo sistema. Escolha um modelo menor (7B → 3B), passe para uma quantização Q4 mais agressiva ou feche os outros serviços.
- Queda brusca na taxa de geração
- Redução de desempenho por aquecimento. Verifique a temperatura no jtop, melhore a refrigeração ou mude para um modo nvpmodel que consuma menos energia, mas seja estável.
- Carregamento de modelo muito lento
- Modelos armazenados em microSD. Mova ~/.ollama (ou seus GGUF) para um SSD NVMe para carregá-los em segundos, em vez de minutos.
- llama.cpp ignora a GPU
- Opção -ngl ausente ou build sem CUDA. Recompile com -DGGML_CUDA=ON e execute com -ngl 99.
#Para se aprofundar
O Jetson compartilha a mesma stack de software de um PC NVIDIA. Estes guias são uma extensão natural da sua configuração embarcada:
- LLM no Raspberry Pi 5: IA local embarcada
- O comparativo direto para execução apenas em CPU, útil para decidir entre Pi e Jetson de acordo com seu projeto e seu orçamento.
- Compilar llama.cpp com CUDA
- Para se aprofundar na compilação a partir do código-fonte e nos ajustes de GPU, que podem ser aplicados à arquitetura ARM do Jetson.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para ajustar o uso de memória à RAM unificada da sua placa Orin.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.