Avançado 13 minEdge

LLM em NVIDIA Jetson Orin: a IA embarcada que cabe na palma da main

O NVIDIA Jetson Orin é a placa que coloca uma GPU CUDA de verdade em um gabinete do tamanho de um baralho. Ao contrário de um Raspberry Pi, o Jetson Orin executa um LLM com aceleração de hardware, o que muda tudo para a IA embarcada: robótica, automação residencial, sensores autônomos. Este guia abrange a escolha da placa (Nano 8 GB ou AGX 64 GB), a instalação do JetPack, a implantação do Ollama e do llama.cpp e os modelos viáveis de acordo com a memória disponível — sempre com execução local.

Você está escolhendo uma máquina? Nossas escolhas por orçamento →

Por Samir K.·Atualização 2026-08-27·Testado no Windows, macOS e Linux
Hardware recomendado

Boa relação custo-benefício para IA local: um GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

Um mini-PC é uma máquina completa: verifique a memória disponível e a compatibilidade do motor. Ele não substitui macOS/MLX ou CUDA.

Por que essa escolha? Nossa ficha completa sobre GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

Compare todas as opções por orçamento, de 800 a 3 500 € →

Orçamento apertado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Em deslocamento: qual notebook para IA local →

Links afiliados — comissão possível sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

#Por que um Jetson Orin para um LLM

Um Jetson Orin não é um microcontrolador: é um módulo system-on-chip que combina uma CPU ARM Cortex, uma GPU NVIDIA com núcleos CUDA e Tensor e memória unificada compartilhada entre os dois. Na prática, a GPU acessa diretamente a RAM do sistema — sem VRAM separada. Um LLM carregado ocupa, portanto, a memória unificada, exatamente como em um Mac Apple Silicon, e o cálculo aproveita a aceleração CUDA.

É isso que diferencia radicalmente um LLM no Jetson Orin de uma IA no Raspberry Pi: enquanto o Pi tem dificuldade usando apenas a CPU, o Orin delega o processamento à GPU e mantém velocidades utilizáveis em modelos de 3B a 8B. Tudo isso com um consumo de 7 a 60 watts, podendo funcionar com bateria, sem ventilador barulhento nem gabinete sob a mesa.

Independência da rede
Sem dependência da nuvem: o modelo roda no próprio equipamento, inclusive em um robô móvel ou em um local isolado sem conexão.
Latência previsível
Sem ida e volta de dados pela internet. A resposta depende apenas da GPU local, o que importa para um ciclo de controle em tempo real.
Privacidade
Os dados de sensores, câmeras ou microfones nunca saem do dispositivo. Fundamental em domótica e em ambientes médicos.
Ecossistema CUDA
A mesma pilha de software de uma GPU NVIDIA de desktop: Ollama, llama.cpp, PyTorch e TensorRT funcionam, com a ressalva de que é preciso compilar para ARM.

#Jetson Orin Nano ou AGX: escolher sua placa

Na linha Orin, a capacidade de memória varia por um fator de 8, e a capacidade de processamento varia ainda mais. Para um LLM, o critério decisivo é a RAM unificada: ela limita o tamanho do modelo exatamente como a VRAM em uma GPU tradicional. Estes são os níveis que importam.

Orin Nano 8 GB
A opção de entrada (~40 TOPS). 8 GB de RAM unificada compartilhada com o sistema. Voltada a modelos 3B em Q4, ou a um 7B com pouca folga de memória se você liberar espaço nela. Ideal para um sensor inteligente ou um assistente de voz embarcado.
Orin NX 8 / 16 GB
Faixa média (~70-100 TOPS). A versão de 16 GB permite rodar confortavelmente modelos 7B-8B em Q4_K_M. Bom compromisso para robótica móvel.
AGX Orin 32 GB
Estação embarcada (~200 TOPS). Executa um 14B em Q4 com contexto ou vários modelos pequenos em paralelo (visão + linguagem).
AGX Orin 64 GB
O modelo topo de linha (~275 TOPS). Voltado para modelos de 32B em Q4 (~19 GB), com margem para o contexto e outras cargas. O único da linha voltado para um uso efetivo de modelos de 32B.
i
Memória unificada = seu limite
No Jetson, GPU e CPU compartilham a mesma RAM. Um modelo que pesa 5 GB deixa proporcionalmente menos espaço para o sistema, para a pilha de visão ou para o ROS. Reserve sempre entre 1,5 e 2 GB para o sistema: em um Nano de 8 GB, conte com cerca de 6 GB realmente utilizáveis para o modelo.
→
Qual placa para qual projeto
Protótipo de automação residencial ou assistente de voz → Orin Nano 8 GB. Robô móvel com percepção → NX 16 GB. Estação de computação embarcada com múltiplos modelos ou 32B → AGX Orin 64 GB. Não é necessário superdimensionar: um 7B bem configurado atende à imensa maioria dos usos embarcados.

#Pré-requisitos e função do JetPack

Todo o ecossistema Jetson se baseia no JetPack, a distribuição de software da NVIDIA. Ela inclui Ubuntu (L4T, Linux for Tegra), os drivers CUDA, cuDNN, TensorRT e as bibliotecas de GPU. Sem a imagem do JetPack corretamente gravada no dispositivo, não há aceleração: você acabaria usando apenas a CPU, perdendo toda a vantagem da placa.

Uma placa Jetson Orin
Nano, NX ou AGX, com a fonte de alimentação adequada (o Nano consome até 15 W e o AGX até 60 W).
Armazenamento rápido
Cartão microSD (UHS-I) para testar o Nano, mas um SSD NVMe é altamente recomendado: os modelos ocupam vários GB, e o carregamento é prejudicado ao usar um cartão SD.
Um PC host com Linux (Ubuntu)
Necessário para gravar o firmware nos AGX/NX via SDK Manager. O Nano Developer Kit pode ser instalado diretamente a partir de uma imagem de cartão SD.
JetPack 6.x
O ramo recente baseado no Ubuntu 22.04, com CUDA 12. É o alvo para uma stack moderna de LLM (Ollama e llama.cpp compilados para a arquitetura ARM SBSA).
!
Verifique a compatibilidade com o JetPack
Nem todas as placas são compatíveis com a mesma versão do JetPack. Os antigos Nano (série anterior) estão limitados a versões mais antigas. Confirme na página oficial do NVIDIA Jetson que seu módulo é compatível com o JetPack 6 antes de começar — uma gravação incorreta do firmware impede a inicialização.

#1. Fazer o flash do JetPack e verificar o CUDA

  1. 01
    Gravar a imagem
    Para um Orin Nano Developer Kit, grave a imagem SD oficial em um cartão com o Balena Etcher, insira o cartão, conecte o equipamento e siga o assistente do Ubuntu. Para um AGX/NX, use o NVIDIA SDK Manager no PC host, com um cabo USB-C e a placa em modo de recuperação.
  2. 02
    Atualizar o sistema
    Na primeira inicialização, atualize os pacotes. Esse também é o momento de instalar os componentes JetPack que faltam, se você tiver usado a imagem SD.
  3. 03
    Verificar a GPU e o CUDA
    Verifique se o CUDA está presente e se o módulo é reconhecido. O jtop (instalado pelo pacote jetson-stats) fornece uma visão em tempo real da GPU, da RAM e do consumo — o equivalente ao nvidia-smi no Jetson.
Verificar o CUDA e o estado do Jetson
# Mettre à jour le système
sudo apt update && sudo apt upgrade -y

# Vérifier la version de CUDA fournie par JetPack
nvcc --version

# Installer jtop (moniteur GPU/RAM/conso pour Jetson)
sudo pip3 install -U jetson-stats
sudo systemctl restart jtop.service

# Lancer le moniteur temps réel
jtop
i
Mudar para o SSD NVMe
Se você tiver um SSD NVMe, migre o sistema para ele (ou pelo menos a pasta dos modelos ~/.ollama). Carregar um modelo de 7B a partir de um cartão microSD pode levar um minuto; a partir de um NVMe, alguns segundos. Em um robô, isso muda a experiência de inicialização.

#2. Instalar o Ollama no JetPack

Ollama é o caminho mais rápido para um primeiro modelo. O script de instalação oficial detecta a arquitetura ARM64 e a GPU Jetson e configura o serviço systemd. Uma vez iniciado, o daemon escuta por padrão em http://localhost:11434, exatamente como em um PC de mesa.

Instalar e iniciar o Ollama no Jetson
# Script d'installation officiel (détecte ARM64 + GPU Jetson)
curl -fsSL https://ollama.com/install.sh | sh

# Le service démarre automatiquement (systemd)
systemctl status ollama

# Tirer et lancer un modèle 3B adapté au Nano
ollama run granite4.2:3b

# Vérifier que le GPU est bien utilisé (pas CPU)
ollama ps
→
Confirmar a aceleração por GPU
Após executar ollama run, abra o jtop em outro terminal: a barra da GPU deve subir durante a geração. Se a GPU permanecer em 0% e a CPU ficar sobrecarregada, a aceleração não está ativa — verifique se o JetPack e o CUDA estão corretamente instalados e se você não está usando uma imagem ARM genérica sem suporte a Tegra.

Para uma interface no estilo ChatGPT, adicione o Open WebUI em um contêiner apontando para o mesmo endpoint. Em um Nano de 8 GB, evite excessos: cada serviço consome memória unificada já contabilizada para o modelo.

#3. Compilar o llama.cpp com CUDA

O Ollama é suficiente para a maioria dos usos, mas compilar o llama.cpp manualmente oferece um controle preciso: escolha da quantização GGUF exata, ajuste do número de camadas transferidas para a GPU e, muitas vezes, alguns tokens por segundo a mais. Também é o caminho para integrar o motor ao seu próprio binário embarcado.

Compilar o llama.cpp com suporte a CUDA no Jetson
# Dépendances de build
sudo apt install -y build-essential cmake git libcurl4-openssl-dev

# Récupérer les sources
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

# Compiler avec CUDA activé (GGML_CUDA=ON)
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)

# Lancer l'inférence en déchargeant les couches sur le GPU (-ngl 99)
./build/bin/llama-cli -m modele-q4_k_m.gguf -ngl 99 -p "Bonjour"
!
A opção -ngl é crucial
Sem -ngl (número de camadas na GPU), o llama.cpp continua usando a CPU e você perde todo o benefício do Jetson. Defina -ngl 99 para transferir o modelo inteiro para a GPU, desde que ele caiba na memória unificada. Se o modelo for muito grande, reduza esse número para usar um modo híbrido CPU/GPU.

#Quais modelos rodam de acordo com a memória disponível

A regra é a mesma que em uma GPU de desktop: com quantização Q4_K_M (o melhor equilíbrio entre qualidade e memória), considere ~2 GB para um 3B, ~5 GB para um 7B, ~9 GB para um 14B e ~19 GB para um 32B. No Jetson, subtraia a memória do sistema da RAM total para saber quanta memória você realmente tem disponível.

Orin Nano 8 GB
Granite 4.2 3B (~2,2 GB), Qwen 3.5 4B (~3,4 GB) ou Gemma 4 E2B (~4,3 GB) em Q4. Um modelo 8B (Granite 4.2 8B, ~5,3 GB) cabe se você fechar todos os outros programas, mas a margem para o contexto continua pequena.
Orin NX 16 GB
Confortável nos modelos 8B–9B (Granite 4.2 8B, Qwen 3.5 9B) em Q4_K_M com contexto. Um 24B (Mistral Small 24B, ~14 GB) cabe em Q4, deixando pouca margem.
AGX Orin 32 GB
Um modelo de 24B (Mistral Small, gpt-oss 20B) com folga, ou um MoE de 30–35B (Qwen 3.6 35B-A3B, ~23 GB). Espaço suficiente para combinar um modelo de linguagem e uma pilha de visão computacional.
AGX Orin 64 GB
Um MoE de 30-35B em qualidade máxima, um 24B em Q8 ou vários modelos carregados simultaneamente. O único patamar que visa seriamente aos modelos grandes com folga.
→
Dê preferência aos modelos pequenos mais recentes
Em sistemas embarcados, um modelo 3B-4B recente (Granite 4.2 3B, Qwen 3.5 4B, Gemma 4 E2B) costuma superar um modelo 7B de geração anterior, usando metade da memória e da potência elétrica. Para um uso específico em robótica ou automação doméstica, um modelo pequeno com prompts bem formulados é mais do que suficiente — não é necessário buscar um modelo grande que esgote sua margem térmica.

#Consumo e modos de alimentação

O principal ponto forte do Jetson é o desempenho por watt. Cada placa oferece modos de alimentação (power modes) que limitam o consumo ativando mais ou menos núcleos da CPU e limitando a frequência da GPU. Esses modos são controlados com nvpmodel, e jetson_clocks força as frequências ao máximo permitido pelo modo.

Controlar os modos de consumo
# Lister les modes d'alimentation disponibles
sudo nvpmodel -q

# Basculer sur le mode le plus performant (index variable selon la carte)
sudo nvpmodel -m 0

# Verrouiller les fréquences au max du mode courant
sudo jetson_clocks

# Suivre conso, GPU et température en direct
jtop
Modo de baixo consumo
No Orin Nano, um modo de 7 W limita bastante a taxa de geração, mas permite alimentação por bateria ou por uma fonte USB-C de baixa potência. Adequado para um sensor que consulta o modelo de forma intermitente.
Modo de potência máxima
O modo MAXN libera todo o potencial da GPU. No AGX Orin, o consumo pode atingir 60 W: preveja a refrigeração (dissipador ativo) e uma fonte de alimentação devidamente dimensionada.
O equilíbrio para sistemas embarcados
Muitos projetos funcionam bem no modo de 15 a 25 W: boa taxa de geração com um modelo de 3B a 7B, dissipação de calor gerenciável e autonomia de bateria razoável.
!
Condições térmicas = taxa real de geração
Um Jetson que esquenta reduz o desempenho por limitação térmica: a taxa de tokens por segundo cai silenciosamente. Em um gabinete fechado em um robô, a dissipação passiva não é suficiente no modo MAXN. Monitore a temperatura no jtop e preveja uma ventoinha ou um dissipador de calor de bom tamanho se exigir muito da placa.

#Casos de uso: robótica e automação residencial

O Jetson se destaca onde um LLM precisa operar o mais próximo possível do mundo físico, sem latência da nuvem nem vazamento de dados. Duas áreas dominam os sistemas embarcados.

Robótica (ROS 2)
O LLM atua como interface de linguagem natural: traduzir uma instrução falada em uma sequência de ações, descrever uma cena percebida pela câmera, raciocinar sobre uma tarefa. O Jetson hospeda ao mesmo tempo a percepção (visão) e a linguagem, na mesma GPU.
Automação residencial local
Um assistente de voz doméstico que controla o Home Assistant sem nunca passar por um serviço de nuvem. O modelo interpreta as solicitações em linguagem natural e aciona as automações — o microfone e os dados permanecem em casa.
Sensor inteligente autônomo
Em um local isolado (agrícola, industrial), o Orin analisa dados localmente e gera sínteses em linguagem natural, que são transmitidas somente quando há uma conexão disponível.
Assistente de campo off-line
Documentação técnica consultável em RAG, integrada a um veículo ou equipamento, funcionando sem rede.
i
A combinação de percepção + linguagem
A principal vantagem do Jetson na robótica é permitir que um modelo de visão (detecção, segmentação via TensorRT) e um LLM coexistam na mesma GPU. Planeje cuidadosamente a memória disponível: em um NX de 16 GB, um modelo de 8B em Q4 (~5,3 GB) deixa espaço para carregar uma pilha de visão, mas não para um segundo modelo grande.

#Em comparação com o Raspberry Pi: a diferença real

A pergunta sempre volta: por que comprar um Jetson quando um Raspberry Pi 5 também roda Ollama? A resposta cabe em uma palavra: GPU. O Pi não tem um acelerador utilizável para a inferência de LLMs; tudo é feito na CPU ARM. Já o Jetson transfere o cálculo para os núcleos CUDA.

Aceleração
Pi 5: apenas CPU, com dificuldade para gerar alguns tokens por segundo em um 3B. Jetson Orin: GPU CUDA, taxa de geração várias vezes maior no mesmo modelo e modelos de 7B a 14B realmente utilizáveis.
Memória
O Pi 5 é limitado a 8/16 GB de RAM para a CPU. O Jetson chega a 64 GB de memória unificada utilizável pela GPU, permitindo rodar modelos fora do alcance do Pi.
Preço
O Pi custa uma fração do preço do Jetson. A diferença de preço é real: o Jetson se justifica quando você precisa de maior taxa de processamento ou de modelos grandes, não para um simples bot de 1B.
Ecossistema
O Pi é generalista e comunitário; o Jetson visa a IA embarcada com CUDA, TensorRT e suporte da NVIDIA para robótica (Isaac).
→
Qual escolher
Bot de texto ocasional, orçamento apertado, 1B a 3B suficientes → Raspberry Pi 5. Taxa de processamento sustentada, visão + linguagem, 7B ou mais, loop em tempo real → Jetson Orin. O custo adicional do Jetson só faz sentido se você realmente aproveitar sua GPU.

#Solução de problemas

Ollama continua rodando na CPU
A GPU não é utilizada se JetPack/CUDA não estiver corretamente instalado ou se você tiver gravado uma imagem ARM genérica sem suporte a Tegra. Verifique nvcc --version e a atividade da GPU no jtop.
Out of memory ao carregar
O modelo excede a memória unificada disponível após descontar a memória usada pelo sistema. Escolha um modelo menor (7B → 3B), passe para uma quantização Q4 mais agressiva ou feche os outros serviços.
Queda brusca na taxa de geração
Redução de desempenho por aquecimento. Verifique a temperatura no jtop, melhore a refrigeração ou mude para um modo nvpmodel que consuma menos energia, mas seja estável.
Carregamento de modelo muito lento
Modelos armazenados em microSD. Mova ~/.ollama (ou seus GGUF) para um SSD NVMe para carregá-los em segundos, em vez de minutos.
llama.cpp ignora a GPU
Opção -ngl ausente ou build sem CUDA. Recompile com -DGGML_CUDA=ON e execute com -ngl 99.
Diagnósticos rápidos no Jetson
# Le GPU est-il vu et actif ?
jtop

# CUDA est-il bien présent ?
nvcc --version

# Ollama utilise-t-il le GPU pour le modèle chargé ?
ollama ps

# Mode d'alimentation courant
sudo nvpmodel -q

#Para se aprofundar

O Jetson compartilha a mesma stack de software de um PC NVIDIA. Estes guias são uma extensão natural da sua configuração embarcada:

LLM no Raspberry Pi 5: IA local embarcada
O comparativo direto para execução apenas em CPU, útil para decidir entre Pi e Jetson de acordo com seu projeto e seu orçamento.
Compilar llama.cpp com CUDA
Para se aprofundar na compilação a partir do código-fonte e nos ajustes de GPU, que podem ser aplicados à arquitetura ARM do Jetson.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para ajustar o uso de memória à RAM unificada da sua placa Orin.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.