Iniciante 8 minConceitos

MoE explicado: por que um 30B-A3B funciona como um pequeno modelo

Desde 2025, a maioria dos grandes lançamentos open-weight tem um ponto em comum: são Mixture of Experts, ou MoE. Vemos nomes como Qwen3 30B-A3B, gpt-oss 120B ou Llama 4 Scout 17B-A2B, com essa notação de dois números que chama a atenção. A ideia é simples quando explicada: um modelo MoE contém muitos parâmetros, mas ativa apenas uma pequena fração a cada token. Como resultado, um modelo de "30 bilhões" pode rodar à velocidade de um modelo de 3 bilhões. Este guia explica o mecanismo, decodifica a notação e detalha o impacto real em sua VRAM e no throughput.

Por Mohamed Meguedmi·Atualização 2026-08-02·Testado no Windows, macOS e Linux

#O problema que o MoE resolve

Um modelo de linguagem clássico é chamado de “denso”: para gerar cada palavra, ele passa seu texto por todos os seus parâmetros. Um modelo denso de 32B utiliza seus 32 bilhões de parâmetros a cada token. É isso que o torna poderoso, mas também lento e exigente em recursos: quanto mais parâmetros, mais processamento e memória são necessários, sem escapatória.

É esse o dilema de rodar modelos localmente. Queremos o conhecimento e a sofisticação de um modelo grande, mas a velocidade e a economia de recursos de um pequeno. Em uma placa voltada ao consumidor, um modelo denso de 70B fica fora de alcance ou é penosamente lento. O Mixture of Experts rompe esse compromisso ao separar duas coisas que se acreditava estarem ligadas: o tamanho do modelo e o custo de cada token.

i
Intuição em uma frase
Um modelo denso faz todos trabalharem em cada pergunta. Um MoE acorda apenas os poucos especialistas relevantes e deixa os outros dormindo.

#O princípio: especialistas ativados sob demanda

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Em um modelo Mixture of Experts, as grandes camadas de cálculo não são mais um bloco único, mas um conjunto de sub-redes chamadas “especialistas”. Um modelo pode conter 64, 128, às vezes mais. Para cada token processado, um pequeno componente de encaminhamento — o “roteador” — analisa o contexto e escolhe apenas 2, 4 ou 8 especialistas para ativar. Os demais especialistas não realizam nenhum cálculo para esse token.

Ao contrário do que o termo sugere, esses especialistas não são temáticos: não há um "especialista em francês" ou um "especialista em código". O roteador é treinado ao mesmo tempo que o modelo e distribui o trabalho de acordo com padrões estatísticos que ninguém controla manualmente. De um token para o outro, a seleção muda. Ao longo de uma frase inteira, quase todos os especialistas acabam sendo usados, mas nunca todos ao mesmo tempo.

Especialistas
Sub-redes especializadas, todas presentes na memória, mas apenas uma minoria trabalha por token.
Roteador (gating)
O componente leve que decide, token a token, quais especialistas ativar.
Especialistas ativos
O número de especialistas ativados por token, geralmente entre 2 e 8. É esse número que define a velocidade.
Parâmetros ativos
O total dos parâmetros realmente utilizados por token — a fração que conta para o cálculo.
→
Uma imagem mental
Imagine um consultório com 128 médicos. O paciente é recebido por um responsável pela triagem que o encaminha para os 4 especialistas adequados. O consultório é imenso (muito conhecimento disponível), mas cada consulta mobiliza apenas 4 pessoas (baixo custo por paciente).

#Decodificar a notação 30B-A3B

A notação que confunde os iniciantes é, na verdade, fácil de entender quando se explica como interpretá-la. Veja o Qwen3 30B-A3B: o primeiro número é o total de parâmetros do modelo; o segundo (depois do “A”, de Active, ou “ativo”) é o número de parâmetros ativos por token.

30B
O modelo contém 30 bilhões de parâmetros no total. Isso determina a memória necessária para carregá-lo.
A3B
Apenas cerca de 3 bilhões de parâmetros estão ativos a cada token. É isso que determina a velocidade de geração.

Em outras palavras, 30B-A3B se lê como “30 bilhões em reserva, 3 bilhões trabalhando”. O modelo tem a riqueza de conhecimentos de um 30B, mas gera aproximadamente à mesma velocidade de um 3B denso. Essa mesma lógica se aplica a todos os outros lançamentos recentes.

Qwen3 30B-A3B
30 bilhões ao todo, 3 bilhões ativos — o MoE para o grande público por excelência.
Llama 4 Scout 17B-A2B
17 bilhões ao todo, cerca de 2 bilhões ativos por token, além de recursos multimodais.
gpt-oss 120B
120 bilhões ao todo, mas apenas cerca de 5 bilhões ativos — por isso sua velocidade surpreendente para o seu tamanho.
DeepSeek V3.2 671B-A37B
671 bilhões em reserva, 37 bilhões ativos: um gigante que « custa » apenas o equivalente a um modelo médio por token.
!
A armadilha na interpretação
O segundo número não reduz a memória: um 30B-A3B ocupa o espaço de um 30B, não de um 3B. O “A3B” acelera o cálculo, não compacta o modelo. Essa é a confusão número 1 entre iniciantes.

#VRAM: o que realmente muda

É o ponto mais mal compreendido, então vamos ser claros. Todos os especialistas de um MoE devem estar carregados na memória, porque o roteador pode chamar qualquer um no token seguinte. A VRAM necessária depende do total de parâmetros, não do número de parâmetros ativos. O dimensionamento de memória de um 30B-A3B é o mesmo de um modelo denso de 30B.

Qwen3 30B-A3B em Q4_K_M
≈ 18–19 GB de VRAM, como um modelo denso de 32B. Portanto, ele é voltado para uma RTX 4090 de 24 GB ou usa também a RAM do sistema em placas menores.
Llama 4 Scout 17B-A2B em Q4
≈ 10-11 GB, dentro das capacidades de uma RTX 4070 12 GB ou de uma 3060 12 GB.
gpt-oss 120B
Dezenas de GB: reservado para configurações potentes ou para offload em RAM/SSD.

A boa notícia sobre o MoE em execução local, portanto, não é a memória, mas a relação qualidade/velocidade com a mesma quantidade de VRAM. Quando um modelo denso de 30B fica lento na sua placa, um MoE 30B-A3B ocupa o mesmo espaço e gera texto muito mais rápido. E como os especialistas inativos não são usados a cada token, os modelos MoE costumam tolerar bem o offload de parte dos pesos para a RAM: os pesos que permanecem na GPU são utilizados prioritariamente.

i
Referência de VRAM em Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Para um MoE, aplique essas referências ao primeiro número (o total), nunca ao número ativo.

#Velocidade: por que é rápido

A velocidade de geração de um LLM depende principalmente do número de parâmetros percorridos a cada token. Como um MoE ativa apenas uma pequena fração deles, a quantidade de cálculo por token cai drasticamente. Na prática, um 30B-A3B gera tokens em um ritmo próximo ao de um modelo denso de 3B, ao mesmo tempo que responde com a profundidade de um 30B.

É exatamente isso que explica a onda de MoE em configurações modestas: obtém-se a qualidade de um modelo grande sem sofrer com sua lentidão. O preço a pagar está em outro lugar — na memória, como já vimos, e no maior espaço ocupado em disco após o download, pois é necessário armazenar todos os especialistas.

O que acelera
Poucos parâmetros ativos por token → menos cálculo → mais tokens por segundo.
O que não muda
A VRAM e o tamanho do arquivo seguem o total de parâmetros.
O ganho líquido
Com a mesma memória, um MoE oferece mais conhecimento com velocidade comparável a um modelo denso muito menor.

#Limites que você deve conhecer

O MoE não é mágico e não torna os modelos densos obsoletos. Com o mesmo número de parâmetros ativos, um modelo denso geralmente fica um passo acima em refinamento de raciocínio: um 30B-A3B é excelente, mas um verdadeiro modelo denso de 30B que ativasse seus 30 bilhões a cada token seria mais forte — ao custo de uma lentidão inaceitável na execução local.

Memória não reduzida
É necessária VRAM para o modelo inteiro. Um MoE não faz um modelo grande caber em uma placa pequena.
Qualidade por token ativa
Com um número comparável de parâmetros ativos, um modelo denso bem treinado costuma manter a vantagem no raciocínio mais avançado.
Download mais pesado
Todos os especialistas estão armazenados: o arquivo GGUF pesa o total, não apenas o ativo.
Sensibilidade à quantização
O roteador e alguns especialistas têm dificuldade com quantização muito agressiva; mantenha Q4_K_M ou acima.
→
Como escolher na prática
Pouca VRAM e necessidade de velocidade com bons conhecimentos? Um MoE se destaca. A prioridade é um raciocínio mais refinado, com bastante VRAM disponível? Um modelo denso com quantidade equivalente de parâmetros ativos pode valer mais a pena.

#Os modelos MoE principais para testar localmente

Aqui estão os modelos Mixture of Experts que mais fazem sentido para testar localmente em 2026, do mais acessível ao mais exigente.

Qwen3 30B-A3B
O melhor ponto de entrada. Qualidade sólida em tarefas gerais e de programação, velocidade notável, ~18 GB em Q4. A referência para descobrir o MoE.
Llama 4 Scout 17B-A2B
MoE multimodal (texto + imagem) e contexto longo, mais leve em VRAM. Ideal se você tiver uma placa de 12 GB.
gpt-oss 120B
O modelo de pesos abertos da OpenAI, com apenas ~5B ativos: impressiona pela velocidade para seu tamanho, mas exige uma configuração robusta.
DeepSeek V3.2 671B-A37B
O monstro. Reservado para configurações com muita RAM e offload agressivo, para quem tem curiosidade sobre os modelos de ponta.

Se você está começando, comece com Qwen3 30B-A3B: é o MoE que melhor demonstra as vantagens da arquitetura em uma única placa voltada ao consumidor comum.

#Experimentar um MoE em 3 minutos

Se o Ollama já estiver instalado e escutando na porta padrão, dois comandos bastam para perceber a diferença entre um modelo MoE e um modelo denso.

  1. 01
    Baixar e iniciar um MoE
    Baixe o Qwen3 30B-A3B e converse com ele imediatamente. A primeira execução baixa o modelo (reserve vários GB).
  2. 02
    Observar a velocidade
    Faça uma pergunta um pouco longa e anote a taxa de geração. Apesar de ter 30 bilhões de parâmetros, ele responde prontamente, à velocidade de um modelo pequeno.
  3. 03
    Comparar com um modelo denso
    Inicie um modelo denso de tamanho semelhante e faça a mesma pergunta. O modelo MoE deverá gerar significativamente mais rápido, com VRAM comparável.
Terminal
# Lancer un MoE et discuter avec
ollama run qwen3:30b-a3b

# Pour comparer avec un dense de taille voisine
ollama run qwen3:32b
i
Verificar a taxa de geração
Adicione a opção --verbose (ollama run qwen3:30b-a3b --verbose) para ver os tokens por segundo no final da resposta e comparar objetivamente modelos MoE e modelos densos em sua máquina.

#Para se aprofundar

É mais fácil entender o MoE relacionando-o aos outros conceitos básicos da execução local. Estes guias dão continuidade direta a este guia:

Escolher sua quantização (Q4, Q5, Q8, FP16)
O MoE é sensível a uma quantização excessivamente agressiva: este guia ajuda a encontrar um bom equilíbrio entre qualidade e memória.
Instalar o Ollama: Windows, macOS e Linux
Para configurar o daemon local na porta 11434 antes de baixar seu primeiro MoE.
Llama 4 Scout localmente: instalação e primeiros testes com Ollama
Um MoE multimodal detalhado passo a passo, para ver a teoria desse guia em ação.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.