MoE explicado: por que um 30B-A3B funciona como um pequeno modelo
Desde 2025, a maioria dos grandes lançamentos open-weight tem um ponto em comum: são Mixture of Experts, ou MoE. Vemos nomes como Qwen3 30B-A3B, gpt-oss 120B ou Llama 4 Scout 17B-A2B, com essa notação de dois números que chama a atenção. A ideia é simples quando explicada: um modelo MoE contém muitos parâmetros, mas ativa apenas uma pequena fração a cada token. Como resultado, um modelo de "30 bilhões" pode rodar à velocidade de um modelo de 3 bilhões. Este guia explica o mecanismo, decodifica a notação e detalha o impacto real em sua VRAM e no throughput.
#O problema que o MoE resolve
Um modelo de linguagem clássico é chamado de “denso”: para gerar cada palavra, ele passa seu texto por todos os seus parâmetros. Um modelo denso de 32B utiliza seus 32 bilhões de parâmetros a cada token. É isso que o torna poderoso, mas também lento e exigente em recursos: quanto mais parâmetros, mais processamento e memória são necessários, sem escapatória.
É esse o dilema de rodar modelos localmente. Queremos o conhecimento e a sofisticação de um modelo grande, mas a velocidade e a economia de recursos de um pequeno. Em uma placa voltada ao consumidor, um modelo denso de 70B fica fora de alcance ou é penosamente lento. O Mixture of Experts rompe esse compromisso ao separar duas coisas que se acreditava estarem ligadas: o tamanho do modelo e o custo de cada token.
#O princípio: especialistas ativados sob demanda
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
Em um modelo Mixture of Experts, as grandes camadas de cálculo não são mais um bloco único, mas um conjunto de sub-redes chamadas “especialistas”. Um modelo pode conter 64, 128, às vezes mais. Para cada token processado, um pequeno componente de encaminhamento — o “roteador” — analisa o contexto e escolhe apenas 2, 4 ou 8 especialistas para ativar. Os demais especialistas não realizam nenhum cálculo para esse token.
Ao contrário do que o termo sugere, esses especialistas não são temáticos: não há um "especialista em francês" ou um "especialista em código". O roteador é treinado ao mesmo tempo que o modelo e distribui o trabalho de acordo com padrões estatísticos que ninguém controla manualmente. De um token para o outro, a seleção muda. Ao longo de uma frase inteira, quase todos os especialistas acabam sendo usados, mas nunca todos ao mesmo tempo.
- Especialistas
- Sub-redes especializadas, todas presentes na memória, mas apenas uma minoria trabalha por token.
- Roteador (gating)
- O componente leve que decide, token a token, quais especialistas ativar.
- Especialistas ativos
- O número de especialistas ativados por token, geralmente entre 2 e 8. É esse número que define a velocidade.
- Parâmetros ativos
- O total dos parâmetros realmente utilizados por token — a fração que conta para o cálculo.
#Decodificar a notação 30B-A3B
A notação que confunde os iniciantes é, na verdade, fácil de entender quando se explica como interpretá-la. Veja o Qwen3 30B-A3B: o primeiro número é o total de parâmetros do modelo; o segundo (depois do “A”, de Active, ou “ativo”) é o número de parâmetros ativos por token.
- 30B
- O modelo contém 30 bilhões de parâmetros no total. Isso determina a memória necessária para carregá-lo.
- A3B
- Apenas cerca de 3 bilhões de parâmetros estão ativos a cada token. É isso que determina a velocidade de geração.
Em outras palavras, 30B-A3B se lê como “30 bilhões em reserva, 3 bilhões trabalhando”. O modelo tem a riqueza de conhecimentos de um 30B, mas gera aproximadamente à mesma velocidade de um 3B denso. Essa mesma lógica se aplica a todos os outros lançamentos recentes.
- Qwen3 30B-A3B
- 30 bilhões ao todo, 3 bilhões ativos — o MoE para o grande público por excelência.
- Llama 4 Scout 17B-A2B
- 17 bilhões ao todo, cerca de 2 bilhões ativos por token, além de recursos multimodais.
- gpt-oss 120B
- 120 bilhões ao todo, mas apenas cerca de 5 bilhões ativos — por isso sua velocidade surpreendente para o seu tamanho.
- DeepSeek V3.2 671B-A37B
- 671 bilhões em reserva, 37 bilhões ativos: um gigante que « custa » apenas o equivalente a um modelo médio por token.
#VRAM: o que realmente muda
É o ponto mais mal compreendido, então vamos ser claros. Todos os especialistas de um MoE devem estar carregados na memória, porque o roteador pode chamar qualquer um no token seguinte. A VRAM necessária depende do total de parâmetros, não do número de parâmetros ativos. O dimensionamento de memória de um 30B-A3B é o mesmo de um modelo denso de 30B.
- Qwen3 30B-A3B em Q4_K_M
- ≈ 18–19 GB de VRAM, como um modelo denso de 32B. Portanto, ele é voltado para uma RTX 4090 de 24 GB ou usa também a RAM do sistema em placas menores.
- Llama 4 Scout 17B-A2B em Q4
- ≈ 10-11 GB, dentro das capacidades de uma RTX 4070 12 GB ou de uma 3060 12 GB.
- gpt-oss 120B
- Dezenas de GB: reservado para configurações potentes ou para offload em RAM/SSD.
A boa notícia sobre o MoE em execução local, portanto, não é a memória, mas a relação qualidade/velocidade com a mesma quantidade de VRAM. Quando um modelo denso de 30B fica lento na sua placa, um MoE 30B-A3B ocupa o mesmo espaço e gera texto muito mais rápido. E como os especialistas inativos não são usados a cada token, os modelos MoE costumam tolerar bem o offload de parte dos pesos para a RAM: os pesos que permanecem na GPU são utilizados prioritariamente.
#Velocidade: por que é rápido
A velocidade de geração de um LLM depende principalmente do número de parâmetros percorridos a cada token. Como um MoE ativa apenas uma pequena fração deles, a quantidade de cálculo por token cai drasticamente. Na prática, um 30B-A3B gera tokens em um ritmo próximo ao de um modelo denso de 3B, ao mesmo tempo que responde com a profundidade de um 30B.
É exatamente isso que explica a onda de MoE em configurações modestas: obtém-se a qualidade de um modelo grande sem sofrer com sua lentidão. O preço a pagar está em outro lugar — na memória, como já vimos, e no maior espaço ocupado em disco após o download, pois é necessário armazenar todos os especialistas.
- O que acelera
- Poucos parâmetros ativos por token → menos cálculo → mais tokens por segundo.
- O que não muda
- A VRAM e o tamanho do arquivo seguem o total de parâmetros.
- O ganho líquido
- Com a mesma memória, um MoE oferece mais conhecimento com velocidade comparável a um modelo denso muito menor.
#Limites que você deve conhecer
O MoE não é mágico e não torna os modelos densos obsoletos. Com o mesmo número de parâmetros ativos, um modelo denso geralmente fica um passo acima em refinamento de raciocínio: um 30B-A3B é excelente, mas um verdadeiro modelo denso de 30B que ativasse seus 30 bilhões a cada token seria mais forte — ao custo de uma lentidão inaceitável na execução local.
- Memória não reduzida
- É necessária VRAM para o modelo inteiro. Um MoE não faz um modelo grande caber em uma placa pequena.
- Qualidade por token ativa
- Com um número comparável de parâmetros ativos, um modelo denso bem treinado costuma manter a vantagem no raciocínio mais avançado.
- Download mais pesado
- Todos os especialistas estão armazenados: o arquivo GGUF pesa o total, não apenas o ativo.
- Sensibilidade à quantização
- O roteador e alguns especialistas têm dificuldade com quantização muito agressiva; mantenha Q4_K_M ou acima.
#Os modelos MoE principais para testar localmente
Aqui estão os modelos Mixture of Experts que mais fazem sentido para testar localmente em 2026, do mais acessível ao mais exigente.
- Qwen3 30B-A3B
- O melhor ponto de entrada. Qualidade sólida em tarefas gerais e de programação, velocidade notável, ~18 GB em Q4. A referência para descobrir o MoE.
- Llama 4 Scout 17B-A2B
- MoE multimodal (texto + imagem) e contexto longo, mais leve em VRAM. Ideal se você tiver uma placa de 12 GB.
- gpt-oss 120B
- O modelo de pesos abertos da OpenAI, com apenas ~5B ativos: impressiona pela velocidade para seu tamanho, mas exige uma configuração robusta.
- DeepSeek V3.2 671B-A37B
- O monstro. Reservado para configurações com muita RAM e offload agressivo, para quem tem curiosidade sobre os modelos de ponta.
Se você está começando, comece com Qwen3 30B-A3B: é o MoE que melhor demonstra as vantagens da arquitetura em uma única placa voltada ao consumidor comum.
#Experimentar um MoE em 3 minutos
Se o Ollama já estiver instalado e escutando na porta padrão, dois comandos bastam para perceber a diferença entre um modelo MoE e um modelo denso.
- 01Baixar e iniciar um MoEBaixe o Qwen3 30B-A3B e converse com ele imediatamente. A primeira execução baixa o modelo (reserve vários GB).
- 02Observar a velocidadeFaça uma pergunta um pouco longa e anote a taxa de geração. Apesar de ter 30 bilhões de parâmetros, ele responde prontamente, à velocidade de um modelo pequeno.
- 03Comparar com um modelo densoInicie um modelo denso de tamanho semelhante e faça a mesma pergunta. O modelo MoE deverá gerar significativamente mais rápido, com VRAM comparável.
#Para se aprofundar
É mais fácil entender o MoE relacionando-o aos outros conceitos básicos da execução local. Estes guias dão continuidade direta a este guia:
- Escolher sua quantização (Q4, Q5, Q8, FP16)
- O MoE é sensível a uma quantização excessivamente agressiva: este guia ajuda a encontrar um bom equilíbrio entre qualidade e memória.
- Instalar o Ollama: Windows, macOS e Linux
- Para configurar o daemon local na porta 11434 antes de baixar seu primeiro MoE.
- Llama 4 Scout localmente: instalação e primeiros testes com Ollama
- Um MoE multimodal detalhado passo a passo, para ver a teoria desse guia em ação.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.