Magistral Small 24B vs Qwen 3 32B: mini-Mistral 2026

Le Magistral Small 24B é o modelo de raciocínio compacto da Mistral AI, desenvolvido para rodar localmente em uma única placa de vídeo voltada ao consumidor final. Em comparação com ele, o Qwen 3 32B da Alibaba se consolidou como uma das referências de pesos abertos na categoria de modelos densos de tamanho médio desde seu lançamento em 2025. Este artigo compara os dois em detalhe: especificações de VRAM por quantização, velocidade de inferência em hardware real, licenças, resultados em benchmarks públicos e cenários de uso concretos. Quer você esteja montando uma estação de trabalho voltada ao raciocínio ou procurando um modelo versátil para processar textos longos, esta página fornece os elementos necessários para escolher.


Apresentação dos dois modelos

Magistral Small 24B

Magistral Small 24B pertence à família Magistral da Mistral AI, ao lado de uma variante maior (Magistral Medium, ~123 bilhões de parâmetros). Sua principal característica é o foco em raciocínio estruturado : o modelo gera uma cadeia de pensamento intermediária (chain-of-thought) antes de produzir sua resposta final, o que o diferencia dos modelos Mistral das gerações anteriores. Com 24 bilhões de parâmetros, ele se destina à categoria de LLM acessíveis em uma GPU de 24 GB com quantização Q4.

A ficha técnica oficial está disponível em HuggingFace — mistralai/Magistral-Small-2506 e noanúncio da Mistral AI.

Qwen 3 32B

O Qwen 3 32B é um modelo dense (não-MoE) desenvolvido pela Alibaba Research, derivado da terceira geração da família Qwen. Sua arquitetura densa o torna mais previsível em termos de consumo de VRAM do que as variantes MoE da mesma família, como o Qwen 3 235B-A22B que ativa apenas 22 bilhões de parâmetros na inferência apesar de ter 235 bilhões no total. O Qwen 3 32B abrange um espectro amplo: codificação, raciocínio matemático, processamento multilíngue, contexto longo.

Documentação oficial sobre HuggingFace — Qwen/Qwen3-32B e no blog Qwen.


Especificações técnicas e VRAM

Para estimativas de VRAM, a regra empírica é: parâmetros × 0,5 a 0,55 GB em Q4, × 1 GB em Q8, × 2 GB em FP16. Os valores abaixo são estimativas baseadas nessa metodologia e em feedbacks da comunidade — verifique conforme seu backend (llama.cpp, llamafile, LM Studio).

Magistral Small 24B

Em Q4_K_M, o modelo cabe com folga na memória de uma RTX 4090 (24 GB), com margem para o cache KV em contextos curtos. Em Q8, a placa atinge seu limite; uma RTX 6000 Ada (48 GB) ou uma A5000 é preferível para sessões longas.

Qwen 3 32B

O Qwen 3 32B cabe em Q4 em uma RTX 4090, mas com um contexto longo (64 K tokens ou mais), o KV-cache eleva o total acima dos 24 GB disponíveis. Para uso confortável com contexto estendido, recomenda-se uma placa de 48 GB (RTX 6000 Ada, A40).

Para aprofundar-se nos cálculos de VRAM por quantização, consulte o guia de VRAM do QualLLM.


Velocidade de inferência

Os números abaixo são estimativas feitas com base em relatos da comunidade sobre llama.cpp e LM Studio. Eles variam conforme o hardware, o comprimento do prompt, o backend e a quantização exata utilizada.

Em RTX 4090 (24 GB, Q4_K_M)

Magistral Small 24B - Geração : ~25–40 tokens/seg (estimado, prompt curto) - Prefill : ~1 500–2 500 tokens/sec (estimado)

Qwen 3 32B - Geração : ~18–28 tokens/sec (estimado, prompt curto) - Prefill : ~1 000–1 800 tokens/sec (estimado)

O modelo mais leve (24B) gera significativamente mais rápido na mesma GPU — cerca de 30 a 50% mais tokens por segundo em Q4 (estimativa). A diferença diminui em GPUs de 48 GB ou em uma configuração de processamento em lote com múltiplas requisições.

Em um Apple M3 Max (128 GB de RAM unificada)

Os Macs com Apple Silicon permitem executar os dois modelos com conforto, inclusive o modelo de 24B em Q8 com 64 GB de RAM.


Licenças

Magistral Small 24B Mistral AI lançou seus modelos abertos sob licença Apache 2.0 ou Modified MIT, conforme as versões. A licença exata do Magistral Small 24B deve ser verificada na página oficial do HuggingFace antes de qualquer uso comercial ou redistribuição. Não assuma a licença apenas com base na família do modelo.

Qwen 3 32B Publicado sob Apache 2.0, o que permite uso comercial, modificação e redistribuição sem pagamento de royalties, desde que sejam mantidos os avisos legais. Esse é um dos pontos fortes concretos do Qwen 3 32B em comparação com modelos com licenças comunitárias mais restritivas.

Para filtrar os modelos do catálogo por tipo de licença, acesse quelllm.fr/catalogue.


Benchmarks e desempenhos comparados

Os números dos benchmarks variam conforme a versão do modelo, o harness de avaliação e os parâmetros de geração. Os valores abaixo são extraídos de relatórios públicos ou estimados — verifique nos leaderboards oficiais como oOpen LLM Leaderboard HuggingFace antes de tomar decisões de implantação com base nisso.

MMLU (conhecimento geral)

O Qwen 3 32B se beneficia do grande volume de dados de treinamento da Alibaba, especialmente rico em conteúdo acadêmico e multilíngue, o que se reflete no MMLU.

HumanEval (programação)

Em codificação pura em benchmarks padrão, Qwen 3 32B mantém a vantagem. O modo de raciocínio do Magistral Small pode, no entanto, compensar em problemas algorítmicos complexos que exigem várias etapas de decomposição.

AIME (raciocínio matemático)

É nos benchmarks de raciocínio como o AIME que o Magistral Small 24B busca se destacar. Sua concepção orientada para chain-of-thought permite abordar problemas de matemática competitiva com uma metodologia estruturada, em vez de correspondência de padrões. As pontuações exatas ainda precisam ser confirmadas nas classificações públicas.

Posicionamento no catálogo QualLLM

Para situar esses dois modelos no ecossistema:


Casos de uso concretos

Quando escolher Magistral Small 24B

Quando escolher Qwen 3 32B


FAQ

P: O Magistral Small 24B roda na RTX 4090?

Sim. Em Q4_K_M, ele exige aproximadamente 13 GB de VRAM — uma RTX 4090 (24 GB) consegue rodar com margem para o KV-cache em contextos curtos. Em Q8, os 24 GB disponíveis são totalmente utilizados; contextos muito longos (32 K tokens preenchidos) podem saturar a memória. Na prática, Q5_K_M representa um bom equilíbrio entre qualidade e VRAM nessa placa.

P: Qual é a licença do Qwen 3 32B?

O Qwen 3 32B é publicado sob Apache 2.0, uma licença permissiva que permite uso comercial, modificação e redistribuição. Não é necessário pagar royalties para integrá-lo a um produto ou serviço, desde que os avisos legais originais sejam preservados. É uma das licenças mais favoráveis do ecossistema de pesos abertos.

P: Magistral Small 24B ou Qwen 3 32B para RAG (Geração Aumentada por Recuperação)?

Para RAG, o Qwen 3 32B tem vantagem devido ao seu contexto nativo de 128 K tokens e ao seu alto desempenho na compreensão de documentos. O Magistral Small 24B pode produzir respostas mais bem estruturadas e fundamentadas para consultas complexas graças ao seu modo de raciocínio. A escolha depende principalmente da extensão dos documentos ingeridos e da complexidade das perguntas feitas.

P: Existe uma diferença significativa de velocidade entre os dois modelos?

Sim. Com 8 bilhões de parâmetros a menos, o Magistral Small 24B é consideravelmente mais rápido na geração na mesma GPU — cerca de 30 a 50% mais tokens por segundo em Q4 na RTX 4090 (estimativa). Essa diferença diminui em GPUs de 80 GB ou em implantações em lote, nas quais a largura de banda da memória deixa de ser o principal fator limitante.

P: O Magistral Small 24B suporta o modo "thinking"?

Sim, essa é sua principal característica em comparação com os LLMs Mistral da geração anterior. Ele gera um raciocínio intermediário antes da resposta final. A ativação é feita por meio do formato do prompt ou de uma opção dedicada, dependendo do backend utilizado (llama.cpp, LM Studio, etc.). Os detalhes de implementação devem ser verificados na documentação oficial do HuggingFace.

P: Como comparar esses modelos com outros LLM do catálogo QualLLM?

Le catálogo QualLLM lista 249 modelos com suas especificações de VRAM, licenças e tokens/segundo filtráveis. Para uma comparação direta com outro modelo de tamanho semelhante, o comparador integrado permite colocar as fichas lado a lado de acordo com seus critérios (VRAM disponível, licença, uso).


Conclusão

Le Magistral Small 24B e o Qwen 3 32B representam duas filosofias para modelos de tamanho semelhante: raciocínio estruturado de um lado, versatilidade densa do outro. Se a sua prioridade é a velocidade de inferência e a qualidade do raciocínio passo a passo em uma GPU de 24 GB, o Magistral Small 24B merece ser avaliado seriamente. Se você prioriza programação, contexto longo e uma licença Apache 2.0 sem ambiguidade, o Qwen 3 32B é uma escolha sólida. Explore todos os modelos filtrados por VRAM e licença em quelllm.fr/catalogue, ou deixe o configurador fazer a seleção de acordo com sua configuração exata.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.