Intermediário 10 minOpenAI

gpt-oss localmente: os modelos open-weights da OpenAI com Ollama

A OpenAI acabou publicando pesos abertos: gpt-oss-20b e gpt-oss-120b, dois modelos de mistura de especialistas sob licença Apache 2.0. Este guia mostra como rodar o gpt-oss com Ollama, quanta VRAM cada versão exige, como funciona a quantização MXFP4 nativa e como ajustar o esforço de raciocínio. Finalizamos com o que realmente valem esses modelos de pesos abertos em comparação com Qwen e DeepSeek.

Por Clara M.·Atualização 2026-07-24·Testado no Windows, macOS e Linux

#Por que o gpt-oss muda a dinâmica

Durante anos, a OpenAI manteve seus modelos fechados. O gpt-oss marca o primeiro retorno da empresa a pesos realmente disponíveis para download desde o GPT-2, desta vez sob a licença Apache 2.0: uso comercial autorizado, sem cláusula de compartilhamento obrigatório, sem limite de usuários. Você baixa os pesos, eles rodam na sua máquina e nada sai da sua rede.

Tecnicamente, o gpt-oss se baseia em uma arquitetura MoE (Mixture of Experts): o modelo contém muitos parâmetros no total, mas ativa apenas uma pequena fração a cada token. Resultado: qualidade próxima à de um grande modelo denso, com o consumo de memória e a velocidade de um modelo muito menor. As duas versões são voltadas ao raciocínio, à chamada de ferramentas e ao cumprimento de instruções, com um contexto de 128k tokens.

gpt-oss-20b
≈ 21 bilhões de parâmetros no total, ≈ 3,6 bilhões ativos por token. Projetado para uma única placa de 16 GB voltada ao consumidor.
gpt-oss-120b
Aproximadamente 117 bilhões de parâmetros no total, aproximadamente 5,1 B ativos por token. Destina-se a uma placa de data center de 80 GB ou a uma máquina com memória unificada de grande porte.
Licença
Apache 2.0 — permite uso comercial, redistribuição e ajuste fino sem restrições de uso.
Quantização
MXFP4 nativo nos pesos dos especialistas: o formato de 4 bits faz parte da publicação, não de uma conversão aproximada feita por terceiros.

#gpt-oss ollama : 20b ou 120b ?

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A escolha depende quase exclusivamente do seu hardware. Os dois modelos compartilham a mesma família e a mesma formatação das respostas; a diferença de qualidade existe, mas é secundária diante da pergunta “isso cabe na minha VRAM?”. Aqui está uma referência simples.

20b — o padrão razoável
Aproximadamente 14 a 16 GB uma vez carregado em MXFP4. Funciona em uma RTX 4080 de 16 GB ou uma RTX 4090, e em um Mac Apple Silicon a partir de 24 GB de memória unificada. É a versão para instalar primeiro.
120b — quando você tem memória
Cerca de 60–65 GB em MXFP4. Ele é voltado para uma GPU de 80 GB (classe H100/A100), uma estação com múltiplas GPUs ou um Mac com muita memória unificada (M3/M5 Ultra com 96 GB ou mais). Não adianta tentar executá-lo com menos de 64 GB de memória disponível para o modelo.
Qualidade relativa
O 120b amplia a diferença no raciocínio em múltiplos passos, no código longo e em tarefas ambíguas. Em perguntas e respostas comuns e em francês, o 20b já se sai muito bem.
i
MoE: poucos parâmetros ativos, mas toda a memória
A arquitetura MoE reduz o cálculo por token, mas não o uso de memória: todos os especialistas devem ser carregados na VRAM, mesmo que apenas um grupo trabalhe em cada etapa. É por isso que o 120b exige ~65 GB, embora ative apenas ~5 bilhões de parâmetros.

#Pré-requisitos

Nada de exótico: uma instalação atualizada do Ollama e memória suficiente para a versão desejada. O Ollama cuida sozinho do download, da quantização MXFP4 e do offload entre GPU e CPU.

Versão recente do Ollama
Versão com suporte a gpt-oss e MXFP4. Atualize antes de começar — versões muito antigas não reconhecem o formato.
VRAM / memória unificada
≥ 16 GB para o 20b, ≥ 64 GB para o 120b. Abaixo disso, o Ollama passará a usar a RAM do sistema, e a velocidade despencará.
Espaço em disco
≈ 12-14 GB para o 20b, ≈ 60-65 GB para o 120b. Os pesos são armazenados no diretório dos modelos Ollama.
Daemon em escuta
O Ollama expõe sua API em http://localhost:11434 por padrão — o que facilita conectar o Open WebUI ou código a essa API.
→
Você ainda não tem Ollama?
Siga primeiro o guia de instalação do Ollama para seu sistema operacional (Windows, macOS ou Linux), depois volte aqui. Todo o restante deste guia pressupõe que o comando ollama responde no seu terminal.

#Instalar gpt-oss-20b em um único comando

A versão 20b pode ser instalada e iniciada com uma única linha de comando. O Ollama baixa os pesos MXFP4, carrega-os na GPU e abre uma sessão de chat.

Terminal
# Télécharge et lance gpt-oss-20b
ollama run gpt-oss:20b

Na primeira execução, considere o tempo para baixar ~13 GB. Depois, o modelo permanece em cache. Para apenas recuperar os pesos sem abrir uma sessão interativa, use pull.

Terminal
# Récupérer sans lancer le chat
ollama pull gpt-oss:20b

# Vérifier que le modèle est présent
ollama list

# Voir s'il tourne bien sur le GPU
ollama ps

Na saída de ollama ps, você deve ver um percentual alto de uso da GPU. Se a coluna mostrar « 100% CPU », é porque o modelo não coube na VRAM e passou a usar a memória do sistema — a geração será lenta. Em uma RTX 4090, espere uma taxa de geração confortável para uso interativo; em uma 4080 de 16 GB, o 20b cabe, mas sem margem para um contexto grande.

Para controlar o modelo via API em vez de pelo chat, o endpoint já está disponível. Veja uma chamada mínima.

API — geração
curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "Explique la quantification MXFP4 en trois phrases.",
  "stream": false
}'

#O 120b, para quais máquinas

O comando é o mesmo, apenas a tag muda. Mas só o execute se realmente tiver a memória disponível: com menos de 64 GB, o Ollama transferirá parte dos especialistas para processamento na CPU, e você obterá, na melhor das hipóteses, alguns tokens por segundo.

Terminal
# ~60-65 Go de mémoire nécessaires
ollama pull gpt-oss:120b
ollama run gpt-oss:120b
  1. 01
    Verificar a memória disponível
    Em GPU NVIDIA, o nvidia-smi deve mostrar uma placa de 80 GB (ou várias placas com quantidade suficiente de VRAM). Em Mac, uma memória unificada de 96 GB ou mais deixa margem para o modelo e o sistema.
  2. 02
    Fazer o pull
    O download é considerável (~60 GB): leve em conta a velocidade da conexão e o espaço em disco. O formato MXFP4 evita que você precise fazer a requantização por conta própria.
  3. 03
    Verificar o posicionamento
    Após executar ollama run, executar ollama ps em outro terminal confirma a porcentagem de uso da GPU. Um offload massivo para a CPU = memória insuficiente; volte para o 20b.
  4. 04
    Ajustar o contexto
    O 120b aceita 128k tokens, mas um contexto completo consome muito mais memória. Reduza num_ctx se estiver com pouca margem de VRAM.
!
Multi-GPU com placas de consumo: atenção às expectativas
Combinar duas RTX 4090 (48 GB) não é suficiente para o 120b, e o compartilhamento entre GPUs via PCIe adiciona latência. Para esse modelo, uma única placa de 80 GB ou uma grande quantidade de memória unificada ainda oferece muito mais fluidez do que uma configuração improvisada com várias placas.

#Ajustar o esforço de raciocínio

Particularidade do gpt-oss: os modelos produzem uma cadeia de raciocínio antes de responderem, e você pode ajustar esse esforço. Três níveis — low, medium, high — estabelecem um equilíbrio entre velocidade e profundidade. Com um esforço baixo, o modelo responde rapidamente a tarefas simples; com um esforço alto, raciocina por mais tempo para resolver problemas de matemática, código ou lógica em múltiplas etapas.

O ajuste é feito na mensagem de sistema. Indique o nível desejado, e o modelo ajusta a extensão de sua reflexão interna.

API — esforço alto
curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [
    { "role": "system", "content": "Reasoning: high" },
    { "role": "user", "content": "Résous : un train part à 14h à 120 km/h, un autre à 15h à 150 km/h. Quand se rejoignent-ils ?" }
  ],
  "stream": false
}'
Raciocínio: baixo
Respostas rápidas, pouca reflexão visível. Ideal para reformulação, resumos curtos e perguntas factuais.
Reasoning: medium
Bom equilíbrio como opção padrão: um pouco de raciocínio sem aumentar demais a latência.
Reasoning: high
Reflexão aprofundada, melhor em problemas difíceis — ao custo de uma geração mais longa e de mais tokens consumidos.
→
O raciocínio custa tokens
Um esforço « high » multiplica os tokens de reflexão antes da resposta final. Em tarefas simples, manter « low » ou « medium » reduz significativamente o tempo de resposta sem perda de qualidade percebida.

#Pontos fortes e fracos em comparação com Qwen e DeepSeek

O gpt-oss chega a um terreno já ocupado por modelos open-weights muito sólidos. Veja em que ele se destaca e em que fica atrás, sem avaliações complacentes.

Pontos fortes
Raciocínio e chamadas de ferramentas bem elaborados, esforço ajustável, licença Apache 2.0 sem ambiguidades e consumo de memória controlado graças ao MoE + MXFP4. O 20b oferece uma excelente relação entre qualidade e VRAM em uma única placa de 16 GB.
Em comparação com Qwen3
O Qwen costuma continuar à frente em tarefas multilíngues e em francês, com uma gama mais ampla de tamanhos (do 4B aos grandes MoE). O gpt-oss compensa com a qualidade de sua cadeia de raciocínio e a precisão com que segue instruções.
Frente a DeepSeek
Os modelos de raciocínio DeepSeek (R1 e V3.2) vão mais longe em problemas muito difíceis, mas exigem muito mais hardware nas versões maiores. O 20b do gpt-oss busca tornar a execução local acessível, enquanto o DeepSeek V3.2 mira o segmento de ponta.
Ponto fraco a conhecer
O francês não é a prioridade do gpt-oss: a qualidade é boa, mas ligeiramente abaixo do inglês, e às vezes abaixo do Qwen. Teste com seus próprios prompts antes de decidir.

#Solução de problemas

« unknown model » ou formato não reconhecido
O seu Ollama é muito antigo para MXFP4. Atualize para uma versão recente e reinicie o pull.
Geração muito lenta no 20b
ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
O modelo 120b trava ou fica extremamente lento
Memória insuficiente. Com menos de 64 GB realmente disponíveis para o modelo, fique no 20b — o 120b não é feito para sua máquina.
Respostas muito lentas em uso comum
Reduza o esforço de raciocínio para low ou medium na mensagem de sistema: high consome uma quantidade enorme de tokens de reflexão.
Contexto que faz o consumo de VRAM disparar
128k tokens consomem muita memória. Defina num_ctx para um valor razoável (por exemplo, 8192) para seus usos cotidianos.

#Para se aprofundar

Depois de instalar o gpt-oss, esses guias do site ajudam a aperfeiçoar sua stack local e a comparar os modelos:

Escolher sua quantização (Q4, Q5, Q8, FP16)
Para entender onde o MXFP4 se situa em relação aos formatos GGUF clássicos e decidir entre qualidade e memória em seus outros modelos.
Escolher sua GPU para IA local
O guia de compra de 2026 para escolher a capacidade da placa conforme você pretenda rodar o 20b com 16 GB ou modelos que exigem mais recursos.
Instalar o DeepSeek R1 com Ollama
Comparação direta em raciocínio: instale o R1 e avalie-o lado a lado com o gpt-oss.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.