Intermediário 10 minOllama

Mistral Magistral: instalar o modelo de raciocínio

Magistral é o modelo de raciocínio da Mistral AI: um modelo que «pensa em voz alta» antes de responder, no estilo de DeepSeek R1 ou OpenAI o1, mas com qualidade nativa em francês que nenhum outro modelo de raciocínio com pesos abertos alcança. Este guia mostra como instalar Mistral Magistral localmente via Ollama, configurá-lo com o template de prompt correto e compará-lo honestamente com DeepSeek R1 destilado.

Por Mohamed Meguedmi·Atualização 2026-08-27·Testado no Windows, macOS e Linux

#Por que escolher Magistral em vez de outro modelo de raciocínio?

Modelos de raciocínio (reasoning models) geram uma cadeia de pensamento explícita antes da resposta final. Em problemas complexos — matemática, lógica, código delicado, análise jurídica — eles ganham de 10 a 30 pontos em benchmarks em comparação com um modelo generalista do mesmo tamanho. O custo: são mais lentos e prolixos.

Até Magistral, as opções com pesos abertos eram principalmente chinesas: DeepSeek R1 e suas distilações, Qwen3 em modo thinking, GLM. Todas raciocinam perfeitamente em inglês e chinês, mas sua cadeia de raciocínio muda regularmente para o chinês mesmo quando o prompt está em francês. Magistral foi treinado especificamente para manter o registro do raciocínio na língua do prompt.

Raciocínio multilíngue nativo
A cadeia de pensamento permanece em francês quando você escreve em francês. Sem alteração brusca para chinês ou inglês.
Apache 2.0 na versão Small
Uso comercial autorizado, fine-tuning livre, redistribuição permitida. Nenhuma área ambígua como com algumas licenças "open" restritivas.
Base Mistral Small 3.1
Boa qualidade de escrita em francês herdada da base, o que se nota na redação de respostas jurídicas ou administrativas.
Contexto de 40 mil tokens
Suficiente para um longo enunciado de problema, vários artigos de código ou um contrato de algumas dezenas de páginas.
i
Raciocínio = tokens adicionais
Conte com 500 a 3.000 tokens de “pensamento” antes de cada resposta final. Em uma GPU modesta, tenha paciência: uma pergunta complexa pode levar de 30 a 60 segundos de geração contínua antes da primeira linha útil.

#Magistral Small versus Magistral Medium

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A Mistral AI disponibiliza o Magistral em duas versões, e a confusão é comum. Para instalar o Magistral da Mistral localmente, apenas a versão Small é utilizável — a versão Medium está disponível apenas via API.

Magistral Small (24B)
Pesos abertos sob a licença Apache 2.0. É ESSE modelo que instalamos localmente. 24 bilhões de parâmetros, derivado de Mistral Small 3.1.
Magistral Medium
Proprietário, acessível apenas pela API da Mistral ou pelo Le Chat. Desempenho superior, mas não pode ser hospedado por você. Fora do escopo deste guia.
→
Dica de nomenclatura
No Ollama Hub, o modelo se chama simplesmente `magistral`. Não é necessário especificar "small": a versão Medium não é distribuída para uso local de qualquer forma.

#Pré-requisitos de hardware

Magistral Small tem 24B parâmetros. Com quantização Q4_K_M (o padrão Ollama), estime cerca de 14 GB de VRAM para carregar o modelo, mais 1 a 3 GB para o contexto, conforme a extensão.

Mínimo confortável
RTX 4080 16 GB, RTX 4090 24 GB, RTX 3090 24 GB ou Mac Apple Silicon com 24 GB de memória unificada.
No limite, mas viável
RTX 4070 Ti Super de 16 GB (Q4 cabe no limite, contexto curto obrigatório) ou Mac da série M de 16 GB com offload parcial.
Insuficiente
Qualquer GPU com 12 GB ou menos. Parte do modelo passa a usar a RAM do sistema, e a velocidade cai para 2-4 tokens/s, inviável para um modelo que precisa produzir milhares de tokens antes de responder.
Ollama e drivers
Ollama ≥ 0.5.x, drivers NVIDIA recentes (CUDA 12), ou Metal no Mac. Verifique com `ollama --version`.
!
Sem GPU de 24 GB? Reconsidere
Magistral não é um modelo para ser testado sem GPU potente. Com 12 GB ou menos, você esperará vários minutos por resposta. Prefira uma distilação de 7B-14B do DeepSeek R1 — com desempenho inferior em francês, mas utilizável em hardware modesto.

#1. Instalação via Ollama

Magistral Small está disponível no Ollama Hub desde seu lançamento oficial pela Mistral. A instalação requer apenas um comando.

  1. 01
    Verifique se o Ollama está rodando
    No Windows/macOS, o aplicativo deve estar em execução (ícone na barra de tarefas). No Linux, `systemctl status ollama` confirma que o serviço está ativo.
  2. 02
    Baixar o modelo
    A quantização padrão fornecida pelo Ollama é Q4_K_M. É um bom equilíbrio para 16 a 24 GB de VRAM.
  3. 03
    Primeira execução
    Ollama baixa ~14 GB no primeiro `pull`. O download inicial pode levar de 10 a 30 minutos dependendo da sua conexão.
  4. 04
    Teste de carregamento
    Execute `ollama run magistral` e depois faça uma pergunta curta. Se o modelo responder após 5 a 10 segundos de "warmup", tudo está bem.
Terminal
ollama pull magistral
ollama run magistral

Para verificar se o modelo está realmente usando a GPU e não a RAM da CPU, use o seguinte comando de verificação:

Status de execução
ollama ps

Na coluna PROCESSOR, você deve ver `100% GPU`. Se você vir `45% CPU / 55% GPU`, sua VRAM é insuficiente: o Ollama já transferiu parte do modelo para a RAM. O modelo funcionará, mas a uma taxa de 1 a 3 tokens por segundo.

#2. O modelo oficial de prompt

O Magistral utiliza um formato de prompt específico para ativar corretamente o raciocínio. O Ollama já inclui esse template no Modelfile oficial, mas é melhor entendê-lo para não desconfigurá-lo involuntariamente com um prompt de sistema mal posicionado.

A estrutura esperada, simplificada:

Formato bruto (interno ao modelo)
<s>[SYSTEM_PROMPT]Vous êtes un assistant qui raisonne soigneusement avant de répondre.[/SYSTEM_PROMPT][INST]Question utilisateur[/INST]
<think>
Chaîne de raisonnement interne...
</think>
Réponse finale</s>

Na prática, você nunca escreve essas tags à mão: Ollama as insere automaticamente. O que é importante saber: o modelo espera que você peça a ele para raciocinar. Um prompt de sistema curto e claro melhora significativamente a qualidade.

Configurar o prompt de sistema
ollama run magistral
>>> /set system "Tu es un assistant rigoureux. Avant chaque réponse, analyse le problème étape par étape en français. Réponds de manière concise après ton raisonnement."
→
Não há necessidade de pedir "pense bem"
Diferentemente de um modelo geralista, Magistral raciocina por padrão. Não é necessário escrever "pense com calma" ou "raciocine passo a passo": isso já é seu modo normal. Por outro lado, pedir explicitamente que ele raciocine em francês no system prompt ajuda a fixar a língua.

#3. Testes iniciais práticos em francês

Aqui estão três prompts para avaliar rapidamente o Magistral em tarefas típicas. Observe que as respostas chegam em dois momentos: primeiro a cadeia de pensamento (`<think>...</think>`), depois a resposta final.

Teste 1 — Problema lógico
>>> Trois personnes se partagent 17 chevaux selon les proportions 1/2, 1/3, 1/9. Comment faire sans couper aucun cheval ?

O Magistral vai desenvolver o raciocínio clássico do camelo emprestado. Espere de 1.500 a 2.500 tokens de pensamento antes da resposta final clara e numerada.

Teste 2 — Código Python
>>> Écris une fonction Python qui trouve le plus long sous-tableau dont la somme vaut zéro. Complexité O(n).

Boa oportunidade para avaliar a qualidade algorítmica. O Magistral geralmente propõe a solução com um dicionário de somas de prefixos, comentando sua escolha de estrutura de dados durante o raciocínio.

Teste 3 — Redação jurídica FR
>>> Rédige une clause de non-concurrence pour un CDI de développeur en France, conforme au droit du travail français actuel.

Em pedidos desse tipo, a qualidade linguística do Magistral em francês faz a diferença. A cláusula gerada é sintaticamente correta, menciona as condições de validade (limitação no tempo e no espaço, contrapartida financeira) e utiliza o vocabulário jurídico francês — não uma tradução mal feita do inglês.

#4. Desempenho: AIME, matemática, código

Mistral AI divulgou números oficiais sobre Magistral Small e Medium. Os valores abaixo são os scores do Small (a única versão que podemos auto-hospedar), arredondados. Eles servem apenas como referência — seus resultados variam de acordo com a quantização e o sampling.

AIME 2024 (olimpíadas de matemática)
Magistral Small ~70%, contra ~50% para o Mistral Small 3.1, que não é um modelo de raciocínio. O ganho do modo de raciocínio é enorme nesse tipo de problema.
LiveCodeBench (código)
Pontuação equivalente ou ligeiramente superior à do Qwen3-Coder 30B-A3B nos problemas de dificuldade média, inferior nos de dificuldade alta.
MMLU FR
Comparável ao Mistral Small 3.1 base — o raciocínio não traz vantagem nas questões de múltipla escolha sobre conhecimentos gerais, em que a resposta foi memorizada ou não.
GPQA Diamond (raciocínio científico)
Ganho claro com o modo thinking, em torno de 50–55%, contra 35–40% da versão base sem raciocínio.
i
Quantização e perda de qualidade
Todos os benchmarks oficiais são medidos em FP16. Em Q4_K_M (o padrão do Ollama), considere uma perda de 1 a 3 pontos no AIME. Se você tiver 24 GB de VRAM, passar para Q5_K_M ou Q6_K recupera essa margem — ao custo de uma taxa de processamento ligeiramente menor.

#5. Magistral Small vs DeepSeek R1 distilado 14B

A comparação útil para quem fala francês é com DeepSeek-R1-Distill-Qwen-14B, o concorrente direto com pesos abertos para quem quer raciocínio local. Os dois têm seus pontos fortes — aqui está o que os testes práticos mostram.

Uso de memória
DeepSeek R1 14B Q4 ≈ 9 GB, Magistral 24B Q4 ≈ 14 GB. Vantagem clara para o DeepSeek se sua GPU estiver limitada a 12 GB.
Qualidade do raciocínio em FR
Magistral mantém o francês do início ao fim. DeepSeek R1 destilado muda regularmente para chinês ou inglês na cadeia de pensamento, mesmo com um prompt de sistema rigoroso em francês. Vantagem para o Magistral.
Qualidade da resposta final em francês
O Magistral produz textos em francês de melhor qualidade (vocabulário, concordância, registro). O DeepSeek R1 14B comete pequenos erros de uso típicos de um modelo traduzido. Vantagem do Magistral.
Matemática pura (AIME, AMC)
DeepSeek R1 destilado 14B é ligeiramente melhor que Magistral Small em problemas muito formais. Vantagem DeepSeek.
Código
Empate na prática. Os dois geram código correto em problemas de dificuldade média. Em código em francês (comentários, nomes de variáveis), o Magistral é mais limpo.
Velocidade de geração
O DeepSeek 14B é ~1,7× mais rápido com a mesma quantidade de VRAM, simplesmente devido ao tamanho. Para uma sessão interativa, isso conta.
→
O veredito prático
Se você trabalha principalmente em francês — direito, escrita, suporte ao usuário, código comentado em francês — o Magistral Small é melhor. Se você trabalha com matemática formal ou usa uma GPU de 12 GB, continue com o DeepSeek R1 destilado de 14B.

#6. Caso de uso: análise jurídica local

A combinação de qualidade em francês + raciocínio + auto-hospedagem torna o Magistral um excelente candidato para tarefas jurídicas sensíveis. O conteúdo jurídico nunca sai da sua máquina — argumento decisivo para um escritório que não pode enviar seus arquivos para a OpenAI.

Três casos concretos que funcionam bem:

Análise de cláusula contratual
Colar uma cláusula, pedir a identificação dos riscos para uma ou outra parte. Magistral explica seu raciocínio, o que torna a análise auditável — um humano pode verificar onde o modelo viu um problema.
Comparação de versões
Colar duas versões de um aditivo, pedir a lista das diferenças substanciais (não cosméticas) e seu impacto. O modo de raciocínio ajuda a separar o ruído do que é substancial.
Redação de nota interna
Solicitar uma nota de síntese com base em um texto de lei ou em um acórdão. A qualidade linguística em francês é o fator diferenciador aqui.
Exemplo de prompt jurídico
>>> /set system "Tu es un juriste qui analyse les contrats en droit français. Raisonne méthodiquement avant de conclure. Cite les principes juridiques mobilisés."
>>> Analyse cette clause de mobilité géographique : [coller le texte]
!
O LLM não substitui um advogado
O Magistral pode alucinar informações sobre o direito francês — citar um artigo que não existe ou referenciar incorretamente uma decisão judicial. Seu valor está em estruturar o pensamento jurídico e acelerar um primeiro rascunho, não em produzir uma conclusão para ser assinada tal como está. Todo trecho destinado a um cliente ou juiz deve ser validado por uma pessoa competente.

#Solução de problemas

O modelo muda para inglês no thinking
Reforce o prompt de sistema com uma instrução explícita: "Pense e responda apenas em francês." Se isso não for suficiente, adicione uma primeira mensagem curta em francês para fixar o idioma antes da pergunta propriamente dita.
Respostas truncadas antes da conclusão
O modelo esgotou seu orçamento de tokens na etapa de raciocínio. Aumente a janela com `/set parameter num_ctx 16384` e `/set parameter num_predict 4096`.
Geração a 1-2 tokens/s
O modelo está na CPU ou em offload parcial. `ollama ps` confirma. Soluções: liberar VRAM (fechar Chrome / Steam), passar para uma quantização mais agressiva como Q3_K_M, ou aceitar que essa GPU não é suficiente.
As tags <think> aparecem na resposta final
Comportamento esperado em modo bruto. Uma interface como Open WebUI ou LM Studio as recolhe automaticamente em um bloco "reasoning" que pode ser expandido ou recolhido. Na CLI do Ollama, elas permanecem visíveis — isso é intencional.
Modelo 'alucina' sobre fatos recentes
O conhecimento do Magistral Small fica limitado à data de treinamento. Para perguntas factuais que exigem informações atualizadas (jurisprudência recente, notícias), é necessário um pipeline RAG, não apenas o modelo isolado.

#Para se aprofundar

Magistral é um excelente modelo em francês para quem tem GPU. Algumas dicas para explorar ao máximo sua instalação:

Comparar com DeepSeek R1 em sua máquina
O guia de instalação do DeepSeek R1 mostra como instalar a versão destilada de 14B em paralelo com o Magistral para testar os dois lado a lado com seus próprios prompts.
Conectar Magistral aos seus PDFs jurídicos
O guia PrivateGPT v2 descreve um pipeline RAG 100% local que complementa perfeitamente Magistral para análise documental confidencial.
Escolher a quantização mais adequada
Se você tiver dúvidas entre Q4_K_M, Q5_K_M ou Q6_K, o guia "Escolher a quantização" apresenta as vantagens e desvantagens de cada opção. Em um modelo de raciocínio, as perdas de quantização são mais evidentes do que em um modelo geral.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.