Intermediário 10 minNVIDIA

Nemotron 3 local: os modelos NVIDIA com Ollama

A NVIDIA não fabrica apenas GPUs: a marca também realiza o pós-treinamento de seus próprios LLMs, a família Nemotron. Este guia mostra como instalar o Nemotron 3 localmente com o Ollama, quais variantes (Nano, Super) escolher de acordo com sua VRAM, o que a NVIDIA otimiza de forma diferente dos demais — raciocínio controlável e uso em agentes — e quando esses modelos valem a pena em comparação com os Qwen3 equivalentes.

Por Clara M.·Atualização 2026-07-28·Testado no Windows, macOS e Linux

#Por que escolher o Nemotron em vez de outro modelo

Nemotron não é um modelo treinado do zero. A NVIDIA parte de bases sólidas com pesos abertos (Llama, Qwen, dependendo da versão) e aplica sua própria receita de pós-treinamento: poda (pruning) para reduzir o tamanho, destilação para recuperar a qualidade perdida e um fine-tuning massivo voltado a raciocínio, matemática, código e chamadas de ferramentas. O resultado tem um objetivo preciso: a melhor relação entre qualidade e custo computacional para tarefas de agente, não para conversação de propósito geral.

Outra particularidade é que a NVIDIA otimiza esses modelos para seu próprio hardware e seus próprios pipelines de inferência. Na prática, isso se traduz em boas taxas de processamento em GPUs NVIDIA e em uma família concebida como uma linha coerente: uma versão pequena para placas voltadas ao público em geral, uma versão média para estações de trabalho e uma versão gigante para servidores. Você escolhe de acordo com a VRAM disponível sem mudar a lógica dos prompts.

i
Nemotron é o Llama/Qwen aprimorado
Se você já conhece Llama ou Qwen em execução local, o Nemotron se comporta de forma familiar: mesmo formato de chat, mesmas quantizações GGUF. A diferença está no pós-treinamento da NVIDIA, não em uma arquitetura exótica.

#Nano, Super e Ultra: qual variante

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A linha Nemotron 3 se divide em três tamanhos, cada um destinado a uma categoria de máquina. O nome indica mais a categoria de máquina a que se destina do que o número exato de parâmetros.

Nano (~8-9B)
A versão para placas de vídeo de uso doméstico. Cabe com folga em uma RTX 3060 de 12 GB ou em qualquer GPU com pelo menos 8 GB de VRAM em Q4. É o ponto de entrada ideal para testar o Nemotron e para agentes leves.
Super (~49B)
A versão para estações de trabalho e GPUs grandes. Busca a qualidade de um modelo de 70B com menor custo computacional, graças à poda da NVIDIA. Exige uma RTX 4090 de 24 GB (com pouca folga em Q4) ou, melhor ainda, uma placa de 32–48 GB.
Ultra (~253B)
A versão para servidores, fora do alcance de um computador de uso doméstico. Reservada a estações com várias GPUs ou a datacenters. Mencionada aqui para situá-la na linha de modelos, não para uso local habitual.

Para um computador local, a escolha real fica entre Nano e Super. Nano se você tiver uma placa de 8 a 16 GB ou se a velocidade for prioridade. Super se você tiver 24 GB ou mais e buscar a qualidade máxima em tarefas exigentes de raciocínio ou programação.

#Requisitos e VRAM por variante

Assim como ocorre com qualquer modelo local, a VRAM é o fator limitante. Aqui estão os valores de referência para a quantização Q4_K_M, recomendada por padrão porque oferece o melhor equilíbrio entre qualidade e memória. Sempre considere uma margem para a janela de contexto, que consome memória além dos pesos.

Nemotron Nano (~9B) — Q4
≈ 6-7 GB de VRAM. Confortável em uma RTX 3060 de 12 GB, uma RTX 4070 de 12 GB ou um Mac com Apple Silicon e pelo menos 16 GB de memória unificada.
Nemotron Super (~49B) — Q4
≈ 28-30 GB. Não cabe em uma única RTX 4090 de 24 GB sem offload: considere uma placa de 32 GB ou mais, duas GPUs ou um Mac M4 Pro/Max com 48 GB de memória unificada.
Nemotron Super — Q5/Q8
Q5_K_M chega perto de 35 GB, Q8_0 ultrapassa 50 GB. Reservado para configurações com muita VRAM ou múltiplas GPUs.
Margem de contexto
Adicione 1 a 4 GB de acordo com o comprimento de contexto desejado. Um contexto longo para raciocínio gera muitos tokens intermediários, o que aumenta o consumo de memória.
→
Verificar o que realmente cabe
Após um comando 'ollama run', execute 'ollama ps' em outro terminal. A coluna PROCESSOR indica '100% GPU' se tudo estiver na VRAM, ou uma divisão 'GPU/CPU' se o Ollama tiver precisado usar também a RAM — nesse caso, a velocidade cai significativamente. Esse é o sinal de que é necessário escolher um modelo de tamanho menor ou reduzir em um nível a quantização.

Quanto ao software, o pré-requisito é mínimo: ter o daemon do Ollama instalado, que escuta por padrão em http://localhost:11434. Se você usa uma GPU NVIDIA, certifique-se de que os drivers CUDA estão atualizados; o Ollama detecta a GPU automaticamente. Usar uma interface como Open WebUI ou LM Studio sobre ele é uma comodidade, não uma obrigação.

#Instalar Nemotron via Ollama

A instalação segue exatamente o fluxo habitual do Ollama. Se o daemon já estiver rodando, apenas um comando baixa e inicia o modelo.

  1. 01
    Verificar se o Ollama está em execução
    Abra um terminal e execute « ollama --version ». Se o comando responder, o daemon está pronto. Caso contrário, instale Ollama primeiro (veja o guia de instalação no final do artigo).
  2. 02
    Baixar a variante Nano
    Para testar sem risco em relação à VRAM, comece com o Nano. O comando baixa os pesos e depois abre uma sessão de chat diretamente no terminal.
  3. 03
    Passar para Super se sua GPU der conta
    Quando você já estiver à vontade e tiver VRAM suficiente, baixe a variante Super para melhorar a qualidade do raciocínio e do código.
  4. 04
    Listar e gerenciar os modelos
    « ollama list » exibe os modelos instalados e seu tamanho em disco. « ollama rm <modelo> » libera espaço de uma variante que você não está usando mais.
Terminal — instalação do Nemotron
# Vérifier qu'Ollama répond
ollama --version

# Variante Nano (~9B) — cartes grand public
ollama run nemotron-nano

# Variante Super (~49B) — grosse VRAM / multi-GPU
ollama run nemotron-super

# Voir ce qui est installé et vérifier le placement GPU
ollama list
ollama ps
!
As tags evoluem
A biblioteca Ollama atualiza regularmente os nomes e as versões dos modelos Nemotron. Antes de executar um comando, verifique a tag exata em ollama.com/library — o nome do modelo e seu número de versão podem diferir do exemplo acima conforme a geração publicada.

Para chamar o Nemotron a partir de seus próprios scripts, a API REST do Ollama está disponível na mesma porta. O campo “model” usa a tag exata do modelo que você baixou.

Terminal — chamada da API
curl http://localhost:11434/api/generate -d '{
  "model": "nemotron-nano",
  "prompt": "Explique la différence entre RAG et fine-tuning en trois phrases.",
  "stream": false
}'

#Modo de raciocínio controlável

A característica marcante dos modelos Nemotron é um raciocínio que você pode ativar ou desativar conforme desejar. A NVIDIA treinou esses modelos para produzir uma cadeia de pensamento detalhada quando isso lhes é solicitado pelo prompt de sistema e para responder diretamente caso contrário. Na prática, você alterna entre dois modos com uma simples instrução de sistema: 'detailed thinking on' para forçar o raciocínio passo a passo, 'detailed thinking off' para uma resposta concisa e rápida.

Essa opção é útil porque o raciocínio tem um custo. Uma cadeia de pensamento gera muitos tokens intermediários: isso é valioso para um problema de matemática, de lógica ou uma depuração sutil, mas é um desperdício para reformular um e-mail. Com o Nemotron, você decide, prompt por prompt, se paga esse custo adicional.

Terminal — ativar o raciocínio
# Dans une session ollama run, définir le system prompt :
/set system detailed thinking on

# Puis poser une question de raisonnement
Un train part de A à 60 km/h, un autre de B à 90 km/h... résous étape par étape.
→
Desativar o raciocínio para ganhar velocidade
Para textos simples, reformulação ou classificação, use «detailed thinking off». Você reduz a latência e economiza tokens sem perda de qualidade nessas tarefas em que pensar em voz alta não traz benefício.

Esse funcionamento aproxima Nemotron de modelos como DeepSeek R1 ou Qwen3 em seu modo « thinking », mas com um controle mais explícito: o raciocínio não é um modo global do modelo, é uma configuração que você controla ao longo da conversa.

#Código, agentes e chamada de ferramentas

A NVIDIA otimiza o Nemotron principalmente para dois usos: raciocínio e uso de agentes de IA. Em programação, as variantes Super competem de igual para igual com bons modelos de 32B a 70B para gerar, explicar e corrigir código. O Nano continua adequado para assistência pontual, mas mostra suas limitações em tarefas longas ou grandes refatorações — isso é esperado para um modelo desse porte.

O verdadeiro diferencial é o function calling. Nemotron é treinado para produzir chamadas de ferramentas confiáveis e bem estruturadas, o que o torna um bom candidato para construir agentes locais: um modelo que decide chamar uma função, lê o resultado e segue para a próxima etapa. Combinado com o modo de raciocínio, isso gera agentes capazes de planejar antes de agir, em vez de agir precipitadamente.

Raciocínio / matemática
Ponto forte claro, especialmente em Super com « detailed thinking on ». A cadeia de pensamento reduz erros de cálculo e de lógica.
Código
Super rivaliza com os 70B em geração e depuração; Nano é adequado para suporte leve e autocompleção.
Agentes e ferramentas
Chamadas de ferramentas confiáveis, formato JSON respeitado — um dos melhores usos da família para automação local.
Francês / conversa geral
Razoável, sem ser o melhor da sua categoria. Nemotron foi feito para raciocinar e agir, menos para conversar em múltiplos idiomas.

#Diante do Qwen3: quando preferir o Nemotron

O Qwen3 é a referência de pesos abertos a comparar, pois as duas famílias atuam no mesmo campo: raciocínio, código, tamanhos variados, modo thinking. Em muitas tarefas gerais e na qualidade do francês, o Qwen3 permanece à frente quando se comparam modelos do mesmo tamanho — é um modelo mais versátil e melhor treinado em múltiplos idiomas.

Nemotron volta a levar vantagem quando seu uso se concentra em agentes de IA e na integração com um ecossistema NVIDIA. Se você está construindo um agente com muitas chamadas de ferramentas, quer um controle explícito do raciocínio prompt a prompt ou utiliza um parque de GPUs NVIDIA em que as taxas de inferência importam, vale a pena testar Nemotron. Por outro lado, para um assistente conversacional generalista em francês, Qwen3 é a escolha padrão mais segura.

Escolher o Nemotron se
Agentes com uso intensivo de chamadas de ferramentas, necessidade de ativar e desativar o raciocínio com controle preciso, infraestrutura 100% NVIDIA ou busca pela melhor relação entre qualidade e custo computacional em raciocínio puro.
Escolher Qwen3 se
Assistente generalista, prioridade ao francês e ao suporte multilíngue, versatilidade nas conversas ou simplesmente o modelo mais testado para uso amplo.
Veredito prático
Teste os dois com tamanho comparável (Nano vs Qwen3-8B, Super vs Qwen3-32B) em seus prompts reais. A diferença depende fortemente da tarefa, não de um ranking abstrato.

#Solução de problemas

« model not found » ao executar pull
A tag não existe com esse nome. Verifique a grafia exata em ollama.com/library — os nomes Nemotron mudam de geração para geração.
Queda drástica de velocidade no Super
O modelo é carregado parcialmente na RAM por falta de VRAM. “ollama ps” mostra uma divisão entre GPU e CPU. Mude para Nano, use uma quantização mais baixa (Q4) ou adicione recursos de GPU.
O raciocínio não é ativado
O prompt de sistema não é levado em conta. Em uma sessão interativa, use “/set system detailed thinking on”; na API, passe a instrução no campo system, e não no prompt do usuário.
Respostas prolixas demais
O modo de raciocínio está ativo por padrão ou por uma configuração herdada. Mude para « detailed thinking off » para tarefas simples.
« Connection refused »
O daemon Ollama não está rodando. Verifique com « ollama ps » e certifique-se de que o serviço esteja escutando em http://localhost:11434.

#Para se aprofundar

Nemotron se apoia em componentes já abordados no site. Estes guias complementam este guia:

Qwen 3 local: teste completo e benchmarks reais
O comparativo indispensável para situar o Nemotron diante de sua principal alternativa de pesos abertos, com números de tokens por segundo.
Escolher sua quantização (Q4, Q5, Q8, FP16)
Para equilibrar qualidade e VRAM no Nemotron Super, onde cada nível de quantização muda o que cabe na sua placa.
Instalar Ollama no Linux
O pré-requisito caso o daemon ainda não esteja instalado: script de instalação, serviço systemd e configuração da GPU NVIDIA.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.