gpt-oss localmente: os modelos open-weights da OpenAI com Ollama
A OpenAI acabou publicando pesos abertos: gpt-oss-20b e gpt-oss-120b, dois modelos de mistura de especialistas sob licença Apache 2.0. Este guia mostra como rodar o gpt-oss com Ollama, quanta VRAM cada versão exige, como funciona a quantização MXFP4 nativa e como ajustar o esforço de raciocínio. Finalizamos com o que realmente valem esses modelos de pesos abertos em comparação com Qwen e DeepSeek.
#Por que o gpt-oss muda a dinâmica
Durante anos, a OpenAI manteve seus modelos fechados. O gpt-oss marca o primeiro retorno da empresa a pesos realmente disponíveis para download desde o GPT-2, desta vez sob a licença Apache 2.0: uso comercial autorizado, sem cláusula de compartilhamento obrigatório, sem limite de usuários. Você baixa os pesos, eles rodam na sua máquina e nada sai da sua rede.
Tecnicamente, o gpt-oss se baseia em uma arquitetura MoE (Mixture of Experts): o modelo contém muitos parâmetros no total, mas ativa apenas uma pequena fração a cada token. Resultado: qualidade próxima à de um grande modelo denso, com o consumo de memória e a velocidade de um modelo muito menor. As duas versões são voltadas ao raciocínio, à chamada de ferramentas e ao cumprimento de instruções, com um contexto de 128k tokens.
- gpt-oss-20b
- ≈ 21 bilhões de parâmetros no total, ≈ 3,6 bilhões ativos por token. Projetado para uma única placa de 16 GB voltada ao consumidor.
- gpt-oss-120b
- Aproximadamente 117 bilhões de parâmetros no total, aproximadamente 5,1 B ativos por token. Destina-se a uma placa de data center de 80 GB ou a uma máquina com memória unificada de grande porte.
- Licença
- Apache 2.0 — permite uso comercial, redistribuição e ajuste fino sem restrições de uso.
- Quantização
- MXFP4 nativo nos pesos dos especialistas: o formato de 4 bits faz parte da publicação, não de uma conversão aproximada feita por terceiros.
#gpt-oss ollama : 20b ou 120b ?
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A escolha depende quase exclusivamente do seu hardware. Os dois modelos compartilham a mesma família e a mesma formatação das respostas; a diferença de qualidade existe, mas é secundária diante da pergunta “isso cabe na minha VRAM?”. Aqui está uma referência simples.
- 20b — o padrão razoável
- Aproximadamente 14 a 16 GB uma vez carregado em MXFP4. Funciona em uma RTX 4080 de 16 GB ou uma RTX 4090, e em um Mac Apple Silicon a partir de 24 GB de memória unificada. É a versão para instalar primeiro.
- 120b — quando você tem memória
- Cerca de 60–65 GB em MXFP4. Ele é voltado para uma GPU de 80 GB (classe H100/A100), uma estação com múltiplas GPUs ou um Mac com muita memória unificada (M3/M5 Ultra com 96 GB ou mais). Não adianta tentar executá-lo com menos de 64 GB de memória disponível para o modelo.
- Qualidade relativa
- O 120b amplia a diferença no raciocínio em múltiplos passos, no código longo e em tarefas ambíguas. Em perguntas e respostas comuns e em francês, o 20b já se sai muito bem.
#Pré-requisitos
Nada de exótico: uma instalação atualizada do Ollama e memória suficiente para a versão desejada. O Ollama cuida sozinho do download, da quantização MXFP4 e do offload entre GPU e CPU.
- Versão recente do Ollama
- Versão com suporte a gpt-oss e MXFP4. Atualize antes de começar — versões muito antigas não reconhecem o formato.
- VRAM / memória unificada
- ≥ 16 GB para o 20b, ≥ 64 GB para o 120b. Abaixo disso, o Ollama passará a usar a RAM do sistema, e a velocidade despencará.
- Espaço em disco
- ≈ 12-14 GB para o 20b, ≈ 60-65 GB para o 120b. Os pesos são armazenados no diretório dos modelos Ollama.
- Daemon em escuta
- O Ollama expõe sua API em http://localhost:11434 por padrão — o que facilita conectar o Open WebUI ou código a essa API.
#Instalar gpt-oss-20b em um único comando
A versão 20b pode ser instalada e iniciada com uma única linha de comando. O Ollama baixa os pesos MXFP4, carrega-os na GPU e abre uma sessão de chat.
Na primeira execução, considere o tempo para baixar ~13 GB. Depois, o modelo permanece em cache. Para apenas recuperar os pesos sem abrir uma sessão interativa, use pull.
Na saída de ollama ps, você deve ver um percentual alto de uso da GPU. Se a coluna mostrar « 100% CPU », é porque o modelo não coube na VRAM e passou a usar a memória do sistema — a geração será lenta. Em uma RTX 4090, espere uma taxa de geração confortável para uso interativo; em uma 4080 de 16 GB, o 20b cabe, mas sem margem para um contexto grande.
Para controlar o modelo via API em vez de pelo chat, o endpoint já está disponível. Veja uma chamada mínima.
#O 120b, para quais máquinas
O comando é o mesmo, apenas a tag muda. Mas só o execute se realmente tiver a memória disponível: com menos de 64 GB, o Ollama transferirá parte dos especialistas para processamento na CPU, e você obterá, na melhor das hipóteses, alguns tokens por segundo.
- 01Verificar a memória disponívelEm GPU NVIDIA, o nvidia-smi deve mostrar uma placa de 80 GB (ou várias placas com quantidade suficiente de VRAM). Em Mac, uma memória unificada de 96 GB ou mais deixa margem para o modelo e o sistema.
- 02Fazer o pullO download é considerável (~60 GB): leve em conta a velocidade da conexão e o espaço em disco. O formato MXFP4 evita que você precise fazer a requantização por conta própria.
- 03Verificar o posicionamentoApós executar ollama run, executar ollama ps em outro terminal confirma a porcentagem de uso da GPU. Um offload massivo para a CPU = memória insuficiente; volte para o 20b.
- 04Ajustar o contextoO 120b aceita 128k tokens, mas um contexto completo consome muito mais memória. Reduza num_ctx se estiver com pouca margem de VRAM.
#Ajustar o esforço de raciocínio
Particularidade do gpt-oss: os modelos produzem uma cadeia de raciocínio antes de responderem, e você pode ajustar esse esforço. Três níveis — low, medium, high — estabelecem um equilíbrio entre velocidade e profundidade. Com um esforço baixo, o modelo responde rapidamente a tarefas simples; com um esforço alto, raciocina por mais tempo para resolver problemas de matemática, código ou lógica em múltiplas etapas.
O ajuste é feito na mensagem de sistema. Indique o nível desejado, e o modelo ajusta a extensão de sua reflexão interna.
- Raciocínio: baixo
- Respostas rápidas, pouca reflexão visível. Ideal para reformulação, resumos curtos e perguntas factuais.
- Reasoning: medium
- Bom equilíbrio como opção padrão: um pouco de raciocínio sem aumentar demais a latência.
- Reasoning: high
- Reflexão aprofundada, melhor em problemas difíceis — ao custo de uma geração mais longa e de mais tokens consumidos.
#Pontos fortes e fracos em comparação com Qwen e DeepSeek
O gpt-oss chega a um terreno já ocupado por modelos open-weights muito sólidos. Veja em que ele se destaca e em que fica atrás, sem avaliações complacentes.
- Pontos fortes
- Raciocínio e chamadas de ferramentas bem elaborados, esforço ajustável, licença Apache 2.0 sem ambiguidades e consumo de memória controlado graças ao MoE + MXFP4. O 20b oferece uma excelente relação entre qualidade e VRAM em uma única placa de 16 GB.
- Em comparação com Qwen3
- O Qwen costuma continuar à frente em tarefas multilíngues e em francês, com uma gama mais ampla de tamanhos (do 4B aos grandes MoE). O gpt-oss compensa com a qualidade de sua cadeia de raciocínio e a precisão com que segue instruções.
- Frente a DeepSeek
- Os modelos de raciocínio DeepSeek (R1 e V3.2) vão mais longe em problemas muito difíceis, mas exigem muito mais hardware nas versões maiores. O 20b do gpt-oss busca tornar a execução local acessível, enquanto o DeepSeek V3.2 mira o segmento de ponta.
- Ponto fraco a conhecer
- O francês não é a prioridade do gpt-oss: a qualidade é boa, mas ligeiramente abaixo do inglês, e às vezes abaixo do Qwen. Teste com seus próprios prompts antes de decidir.
#Solução de problemas
- « unknown model » ou formato não reconhecido
- O seu Ollama é muito antigo para MXFP4. Atualize para uma versão recente e reinicie o pull.
- Geração muito lenta no 20b
- ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
- O modelo 120b trava ou fica extremamente lento
- Memória insuficiente. Com menos de 64 GB realmente disponíveis para o modelo, fique no 20b — o 120b não é feito para sua máquina.
- Respostas muito lentas em uso comum
- Reduza o esforço de raciocínio para low ou medium na mensagem de sistema: high consome uma quantidade enorme de tokens de reflexão.
- Contexto que faz o consumo de VRAM disparar
- 128k tokens consomem muita memória. Defina num_ctx para um valor razoável (por exemplo, 8192) para seus usos cotidianos.
#Para se aprofundar
Depois de instalar o gpt-oss, esses guias do site ajudam a aperfeiçoar sua stack local e a comparar os modelos:
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- Para entender onde o MXFP4 se situa em relação aos formatos GGUF clássicos e decidir entre qualidade e memória em seus outros modelos.
- Escolher sua GPU para IA local
- O guia de compra de 2026 para escolher a capacidade da placa conforme você pretenda rodar o 20b com 16 GB ou modelos que exigem mais recursos.
- Instalar o DeepSeek R1 com Ollama
- Comparação direta em raciocínio: instale o R1 e avalie-o lado a lado com o gpt-oss.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.