Nemotron 3 local: os modelos NVIDIA com Ollama
A NVIDIA não fabrica apenas GPUs: a marca também realiza o pós-treinamento de seus próprios LLMs, a família Nemotron. Este guia mostra como instalar o Nemotron 3 localmente com o Ollama, quais variantes (Nano, Super) escolher de acordo com sua VRAM, o que a NVIDIA otimiza de forma diferente dos demais — raciocínio controlável e uso em agentes — e quando esses modelos valem a pena em comparação com os Qwen3 equivalentes.
#Por que escolher o Nemotron em vez de outro modelo
Nemotron não é um modelo treinado do zero. A NVIDIA parte de bases sólidas com pesos abertos (Llama, Qwen, dependendo da versão) e aplica sua própria receita de pós-treinamento: poda (pruning) para reduzir o tamanho, destilação para recuperar a qualidade perdida e um fine-tuning massivo voltado a raciocínio, matemática, código e chamadas de ferramentas. O resultado tem um objetivo preciso: a melhor relação entre qualidade e custo computacional para tarefas de agente, não para conversação de propósito geral.
Outra particularidade é que a NVIDIA otimiza esses modelos para seu próprio hardware e seus próprios pipelines de inferência. Na prática, isso se traduz em boas taxas de processamento em GPUs NVIDIA e em uma família concebida como uma linha coerente: uma versão pequena para placas voltadas ao público em geral, uma versão média para estações de trabalho e uma versão gigante para servidores. Você escolhe de acordo com a VRAM disponível sem mudar a lógica dos prompts.
#Nano, Super e Ultra: qual variante
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A linha Nemotron 3 se divide em três tamanhos, cada um destinado a uma categoria de máquina. O nome indica mais a categoria de máquina a que se destina do que o número exato de parâmetros.
- Nano (~8-9B)
- A versão para placas de vídeo de uso doméstico. Cabe com folga em uma RTX 3060 de 12 GB ou em qualquer GPU com pelo menos 8 GB de VRAM em Q4. É o ponto de entrada ideal para testar o Nemotron e para agentes leves.
- Super (~49B)
- A versão para estações de trabalho e GPUs grandes. Busca a qualidade de um modelo de 70B com menor custo computacional, graças à poda da NVIDIA. Exige uma RTX 4090 de 24 GB (com pouca folga em Q4) ou, melhor ainda, uma placa de 32–48 GB.
- Ultra (~253B)
- A versão para servidores, fora do alcance de um computador de uso doméstico. Reservada a estações com várias GPUs ou a datacenters. Mencionada aqui para situá-la na linha de modelos, não para uso local habitual.
Para um computador local, a escolha real fica entre Nano e Super. Nano se você tiver uma placa de 8 a 16 GB ou se a velocidade for prioridade. Super se você tiver 24 GB ou mais e buscar a qualidade máxima em tarefas exigentes de raciocínio ou programação.
#Requisitos e VRAM por variante
Assim como ocorre com qualquer modelo local, a VRAM é o fator limitante. Aqui estão os valores de referência para a quantização Q4_K_M, recomendada por padrão porque oferece o melhor equilíbrio entre qualidade e memória. Sempre considere uma margem para a janela de contexto, que consome memória além dos pesos.
- Nemotron Nano (~9B) — Q4
- ≈ 6-7 GB de VRAM. Confortável em uma RTX 3060 de 12 GB, uma RTX 4070 de 12 GB ou um Mac com Apple Silicon e pelo menos 16 GB de memória unificada.
- Nemotron Super (~49B) — Q4
- ≈ 28-30 GB. Não cabe em uma única RTX 4090 de 24 GB sem offload: considere uma placa de 32 GB ou mais, duas GPUs ou um Mac M4 Pro/Max com 48 GB de memória unificada.
- Nemotron Super — Q5/Q8
- Q5_K_M chega perto de 35 GB, Q8_0 ultrapassa 50 GB. Reservado para configurações com muita VRAM ou múltiplas GPUs.
- Margem de contexto
- Adicione 1 a 4 GB de acordo com o comprimento de contexto desejado. Um contexto longo para raciocínio gera muitos tokens intermediários, o que aumenta o consumo de memória.
Quanto ao software, o pré-requisito é mínimo: ter o daemon do Ollama instalado, que escuta por padrão em http://localhost:11434. Se você usa uma GPU NVIDIA, certifique-se de que os drivers CUDA estão atualizados; o Ollama detecta a GPU automaticamente. Usar uma interface como Open WebUI ou LM Studio sobre ele é uma comodidade, não uma obrigação.
#Instalar Nemotron via Ollama
A instalação segue exatamente o fluxo habitual do Ollama. Se o daemon já estiver rodando, apenas um comando baixa e inicia o modelo.
- 01Verificar se o Ollama está em execuçãoAbra um terminal e execute « ollama --version ». Se o comando responder, o daemon está pronto. Caso contrário, instale Ollama primeiro (veja o guia de instalação no final do artigo).
- 02Baixar a variante NanoPara testar sem risco em relação à VRAM, comece com o Nano. O comando baixa os pesos e depois abre uma sessão de chat diretamente no terminal.
- 03Passar para Super se sua GPU der contaQuando você já estiver à vontade e tiver VRAM suficiente, baixe a variante Super para melhorar a qualidade do raciocínio e do código.
- 04Listar e gerenciar os modelos« ollama list » exibe os modelos instalados e seu tamanho em disco. « ollama rm <modelo> » libera espaço de uma variante que você não está usando mais.
Para chamar o Nemotron a partir de seus próprios scripts, a API REST do Ollama está disponível na mesma porta. O campo “model” usa a tag exata do modelo que você baixou.
#Modo de raciocínio controlável
A característica marcante dos modelos Nemotron é um raciocínio que você pode ativar ou desativar conforme desejar. A NVIDIA treinou esses modelos para produzir uma cadeia de pensamento detalhada quando isso lhes é solicitado pelo prompt de sistema e para responder diretamente caso contrário. Na prática, você alterna entre dois modos com uma simples instrução de sistema: 'detailed thinking on' para forçar o raciocínio passo a passo, 'detailed thinking off' para uma resposta concisa e rápida.
Essa opção é útil porque o raciocínio tem um custo. Uma cadeia de pensamento gera muitos tokens intermediários: isso é valioso para um problema de matemática, de lógica ou uma depuração sutil, mas é um desperdício para reformular um e-mail. Com o Nemotron, você decide, prompt por prompt, se paga esse custo adicional.
Esse funcionamento aproxima Nemotron de modelos como DeepSeek R1 ou Qwen3 em seu modo « thinking », mas com um controle mais explícito: o raciocínio não é um modo global do modelo, é uma configuração que você controla ao longo da conversa.
#Código, agentes e chamada de ferramentas
A NVIDIA otimiza o Nemotron principalmente para dois usos: raciocínio e uso de agentes de IA. Em programação, as variantes Super competem de igual para igual com bons modelos de 32B a 70B para gerar, explicar e corrigir código. O Nano continua adequado para assistência pontual, mas mostra suas limitações em tarefas longas ou grandes refatorações — isso é esperado para um modelo desse porte.
O verdadeiro diferencial é o function calling. Nemotron é treinado para produzir chamadas de ferramentas confiáveis e bem estruturadas, o que o torna um bom candidato para construir agentes locais: um modelo que decide chamar uma função, lê o resultado e segue para a próxima etapa. Combinado com o modo de raciocínio, isso gera agentes capazes de planejar antes de agir, em vez de agir precipitadamente.
- Raciocínio / matemática
- Ponto forte claro, especialmente em Super com « detailed thinking on ». A cadeia de pensamento reduz erros de cálculo e de lógica.
- Código
- Super rivaliza com os 70B em geração e depuração; Nano é adequado para suporte leve e autocompleção.
- Agentes e ferramentas
- Chamadas de ferramentas confiáveis, formato JSON respeitado — um dos melhores usos da família para automação local.
- Francês / conversa geral
- Razoável, sem ser o melhor da sua categoria. Nemotron foi feito para raciocinar e agir, menos para conversar em múltiplos idiomas.
#Diante do Qwen3: quando preferir o Nemotron
O Qwen3 é a referência de pesos abertos a comparar, pois as duas famílias atuam no mesmo campo: raciocínio, código, tamanhos variados, modo thinking. Em muitas tarefas gerais e na qualidade do francês, o Qwen3 permanece à frente quando se comparam modelos do mesmo tamanho — é um modelo mais versátil e melhor treinado em múltiplos idiomas.
Nemotron volta a levar vantagem quando seu uso se concentra em agentes de IA e na integração com um ecossistema NVIDIA. Se você está construindo um agente com muitas chamadas de ferramentas, quer um controle explícito do raciocínio prompt a prompt ou utiliza um parque de GPUs NVIDIA em que as taxas de inferência importam, vale a pena testar Nemotron. Por outro lado, para um assistente conversacional generalista em francês, Qwen3 é a escolha padrão mais segura.
- Escolher o Nemotron se
- Agentes com uso intensivo de chamadas de ferramentas, necessidade de ativar e desativar o raciocínio com controle preciso, infraestrutura 100% NVIDIA ou busca pela melhor relação entre qualidade e custo computacional em raciocínio puro.
- Escolher Qwen3 se
- Assistente generalista, prioridade ao francês e ao suporte multilíngue, versatilidade nas conversas ou simplesmente o modelo mais testado para uso amplo.
- Veredito prático
- Teste os dois com tamanho comparável (Nano vs Qwen3-8B, Super vs Qwen3-32B) em seus prompts reais. A diferença depende fortemente da tarefa, não de um ranking abstrato.
#Solução de problemas
- « model not found » ao executar pull
- A tag não existe com esse nome. Verifique a grafia exata em ollama.com/library — os nomes Nemotron mudam de geração para geração.
- Queda drástica de velocidade no Super
- O modelo é carregado parcialmente na RAM por falta de VRAM. “ollama ps” mostra uma divisão entre GPU e CPU. Mude para Nano, use uma quantização mais baixa (Q4) ou adicione recursos de GPU.
- O raciocínio não é ativado
- O prompt de sistema não é levado em conta. Em uma sessão interativa, use “/set system detailed thinking on”; na API, passe a instrução no campo system, e não no prompt do usuário.
- Respostas prolixas demais
- O modo de raciocínio está ativo por padrão ou por uma configuração herdada. Mude para « detailed thinking off » para tarefas simples.
- « Connection refused »
- O daemon Ollama não está rodando. Verifique com « ollama ps » e certifique-se de que o serviço esteja escutando em http://localhost:11434.
#Para se aprofundar
Nemotron se apoia em componentes já abordados no site. Estes guias complementam este guia:
- Qwen 3 local: teste completo e benchmarks reais
- O comparativo indispensável para situar o Nemotron diante de sua principal alternativa de pesos abertos, com números de tokens por segundo.
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para equilibrar qualidade e VRAM no Nemotron Super, onde cada nível de quantização muda o que cabe na sua placa.
- Instalar Ollama no Linux
- O pré-requisito caso o daemon ainda não esteja instalado: script de instalação, serviço systemd e configuração da GPU NVIDIA.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.