Mistral Magistral: instalar o modelo de raciocínio
Magistral é o modelo de raciocínio da Mistral AI: um modelo que «pensa em voz alta» antes de responder, no estilo de DeepSeek R1 ou OpenAI o1, mas com qualidade nativa em francês que nenhum outro modelo de raciocínio com pesos abertos alcança. Este guia mostra como instalar Mistral Magistral localmente via Ollama, configurá-lo com o template de prompt correto e compará-lo honestamente com DeepSeek R1 destilado.
#Por que escolher Magistral em vez de outro modelo de raciocínio?
Modelos de raciocínio (reasoning models) geram uma cadeia de pensamento explícita antes da resposta final. Em problemas complexos — matemática, lógica, código delicado, análise jurídica — eles ganham de 10 a 30 pontos em benchmarks em comparação com um modelo generalista do mesmo tamanho. O custo: são mais lentos e prolixos.
Até Magistral, as opções com pesos abertos eram principalmente chinesas: DeepSeek R1 e suas distilações, Qwen3 em modo thinking, GLM. Todas raciocinam perfeitamente em inglês e chinês, mas sua cadeia de raciocínio muda regularmente para o chinês mesmo quando o prompt está em francês. Magistral foi treinado especificamente para manter o registro do raciocínio na língua do prompt.
- Raciocínio multilíngue nativo
- A cadeia de pensamento permanece em francês quando você escreve em francês. Sem alteração brusca para chinês ou inglês.
- Apache 2.0 na versão Small
- Uso comercial autorizado, fine-tuning livre, redistribuição permitida. Nenhuma área ambígua como com algumas licenças "open" restritivas.
- Base Mistral Small 3.1
- Boa qualidade de escrita em francês herdada da base, o que se nota na redação de respostas jurídicas ou administrativas.
- Contexto de 40 mil tokens
- Suficiente para um longo enunciado de problema, vários artigos de código ou um contrato de algumas dezenas de páginas.
#Magistral Small versus Magistral Medium
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
A Mistral AI disponibiliza o Magistral em duas versões, e a confusão é comum. Para instalar o Magistral da Mistral localmente, apenas a versão Small é utilizável — a versão Medium está disponível apenas via API.
- Magistral Small (24B)
- Pesos abertos sob a licença Apache 2.0. É ESSE modelo que instalamos localmente. 24 bilhões de parâmetros, derivado de Mistral Small 3.1.
- Magistral Medium
- Proprietário, acessível apenas pela API da Mistral ou pelo Le Chat. Desempenho superior, mas não pode ser hospedado por você. Fora do escopo deste guia.
#Pré-requisitos de hardware
Magistral Small tem 24B parâmetros. Com quantização Q4_K_M (o padrão Ollama), estime cerca de 14 GB de VRAM para carregar o modelo, mais 1 a 3 GB para o contexto, conforme a extensão.
- Mínimo confortável
- RTX 4080 16 GB, RTX 4090 24 GB, RTX 3090 24 GB ou Mac Apple Silicon com 24 GB de memória unificada.
- No limite, mas viável
- RTX 4070 Ti Super de 16 GB (Q4 cabe no limite, contexto curto obrigatório) ou Mac da série M de 16 GB com offload parcial.
- Insuficiente
- Qualquer GPU com 12 GB ou menos. Parte do modelo passa a usar a RAM do sistema, e a velocidade cai para 2-4 tokens/s, inviável para um modelo que precisa produzir milhares de tokens antes de responder.
- Ollama e drivers
- Ollama ≥ 0.5.x, drivers NVIDIA recentes (CUDA 12), ou Metal no Mac. Verifique com `ollama --version`.
#1. Instalação via Ollama
Magistral Small está disponível no Ollama Hub desde seu lançamento oficial pela Mistral. A instalação requer apenas um comando.
- 01Verifique se o Ollama está rodandoNo Windows/macOS, o aplicativo deve estar em execução (ícone na barra de tarefas). No Linux, `systemctl status ollama` confirma que o serviço está ativo.
- 02Baixar o modeloA quantização padrão fornecida pelo Ollama é Q4_K_M. É um bom equilíbrio para 16 a 24 GB de VRAM.
- 03Primeira execuçãoOllama baixa ~14 GB no primeiro `pull`. O download inicial pode levar de 10 a 30 minutos dependendo da sua conexão.
- 04Teste de carregamentoExecute `ollama run magistral` e depois faça uma pergunta curta. Se o modelo responder após 5 a 10 segundos de "warmup", tudo está bem.
Para verificar se o modelo está realmente usando a GPU e não a RAM da CPU, use o seguinte comando de verificação:
Na coluna PROCESSOR, você deve ver `100% GPU`. Se você vir `45% CPU / 55% GPU`, sua VRAM é insuficiente: o Ollama já transferiu parte do modelo para a RAM. O modelo funcionará, mas a uma taxa de 1 a 3 tokens por segundo.
#2. O modelo oficial de prompt
O Magistral utiliza um formato de prompt específico para ativar corretamente o raciocínio. O Ollama já inclui esse template no Modelfile oficial, mas é melhor entendê-lo para não desconfigurá-lo involuntariamente com um prompt de sistema mal posicionado.
A estrutura esperada, simplificada:
Na prática, você nunca escreve essas tags à mão: Ollama as insere automaticamente. O que é importante saber: o modelo espera que você peça a ele para raciocinar. Um prompt de sistema curto e claro melhora significativamente a qualidade.
#3. Testes iniciais práticos em francês
Aqui estão três prompts para avaliar rapidamente o Magistral em tarefas típicas. Observe que as respostas chegam em dois momentos: primeiro a cadeia de pensamento (`<think>...</think>`), depois a resposta final.
O Magistral vai desenvolver o raciocínio clássico do camelo emprestado. Espere de 1.500 a 2.500 tokens de pensamento antes da resposta final clara e numerada.
Boa oportunidade para avaliar a qualidade algorítmica. O Magistral geralmente propõe a solução com um dicionário de somas de prefixos, comentando sua escolha de estrutura de dados durante o raciocínio.
Em pedidos desse tipo, a qualidade linguística do Magistral em francês faz a diferença. A cláusula gerada é sintaticamente correta, menciona as condições de validade (limitação no tempo e no espaço, contrapartida financeira) e utiliza o vocabulário jurídico francês — não uma tradução mal feita do inglês.
#4. Desempenho: AIME, matemática, código
Mistral AI divulgou números oficiais sobre Magistral Small e Medium. Os valores abaixo são os scores do Small (a única versão que podemos auto-hospedar), arredondados. Eles servem apenas como referência — seus resultados variam de acordo com a quantização e o sampling.
- AIME 2024 (olimpíadas de matemática)
- Magistral Small ~70%, contra ~50% para o Mistral Small 3.1, que não é um modelo de raciocínio. O ganho do modo de raciocínio é enorme nesse tipo de problema.
- LiveCodeBench (código)
- Pontuação equivalente ou ligeiramente superior à do Qwen3-Coder 30B-A3B nos problemas de dificuldade média, inferior nos de dificuldade alta.
- MMLU FR
- Comparável ao Mistral Small 3.1 base — o raciocínio não traz vantagem nas questões de múltipla escolha sobre conhecimentos gerais, em que a resposta foi memorizada ou não.
- GPQA Diamond (raciocínio científico)
- Ganho claro com o modo thinking, em torno de 50–55%, contra 35–40% da versão base sem raciocínio.
#5. Magistral Small vs DeepSeek R1 distilado 14B
A comparação útil para quem fala francês é com DeepSeek-R1-Distill-Qwen-14B, o concorrente direto com pesos abertos para quem quer raciocínio local. Os dois têm seus pontos fortes — aqui está o que os testes práticos mostram.
- Uso de memória
- DeepSeek R1 14B Q4 ≈ 9 GB, Magistral 24B Q4 ≈ 14 GB. Vantagem clara para o DeepSeek se sua GPU estiver limitada a 12 GB.
- Qualidade do raciocínio em FR
- Magistral mantém o francês do início ao fim. DeepSeek R1 destilado muda regularmente para chinês ou inglês na cadeia de pensamento, mesmo com um prompt de sistema rigoroso em francês. Vantagem para o Magistral.
- Qualidade da resposta final em francês
- O Magistral produz textos em francês de melhor qualidade (vocabulário, concordância, registro). O DeepSeek R1 14B comete pequenos erros de uso típicos de um modelo traduzido. Vantagem do Magistral.
- Matemática pura (AIME, AMC)
- DeepSeek R1 destilado 14B é ligeiramente melhor que Magistral Small em problemas muito formais. Vantagem DeepSeek.
- Código
- Empate na prática. Os dois geram código correto em problemas de dificuldade média. Em código em francês (comentários, nomes de variáveis), o Magistral é mais limpo.
- Velocidade de geração
- O DeepSeek 14B é ~1,7× mais rápido com a mesma quantidade de VRAM, simplesmente devido ao tamanho. Para uma sessão interativa, isso conta.
#6. Caso de uso: análise jurídica local
A combinação de qualidade em francês + raciocínio + auto-hospedagem torna o Magistral um excelente candidato para tarefas jurídicas sensíveis. O conteúdo jurídico nunca sai da sua máquina — argumento decisivo para um escritório que não pode enviar seus arquivos para a OpenAI.
Três casos concretos que funcionam bem:
- Análise de cláusula contratual
- Colar uma cláusula, pedir a identificação dos riscos para uma ou outra parte. Magistral explica seu raciocínio, o que torna a análise auditável — um humano pode verificar onde o modelo viu um problema.
- Comparação de versões
- Colar duas versões de um aditivo, pedir a lista das diferenças substanciais (não cosméticas) e seu impacto. O modo de raciocínio ajuda a separar o ruído do que é substancial.
- Redação de nota interna
- Solicitar uma nota de síntese com base em um texto de lei ou em um acórdão. A qualidade linguística em francês é o fator diferenciador aqui.
#Solução de problemas
- O modelo muda para inglês no thinking
- Reforce o prompt de sistema com uma instrução explícita: "Pense e responda apenas em francês." Se isso não for suficiente, adicione uma primeira mensagem curta em francês para fixar o idioma antes da pergunta propriamente dita.
- Respostas truncadas antes da conclusão
- O modelo esgotou seu orçamento de tokens na etapa de raciocínio. Aumente a janela com `/set parameter num_ctx 16384` e `/set parameter num_predict 4096`.
- Geração a 1-2 tokens/s
- O modelo está na CPU ou em offload parcial. `ollama ps` confirma. Soluções: liberar VRAM (fechar Chrome / Steam), passar para uma quantização mais agressiva como Q3_K_M, ou aceitar que essa GPU não é suficiente.
- As tags <think> aparecem na resposta final
- Comportamento esperado em modo bruto. Uma interface como Open WebUI ou LM Studio as recolhe automaticamente em um bloco "reasoning" que pode ser expandido ou recolhido. Na CLI do Ollama, elas permanecem visíveis — isso é intencional.
- Modelo 'alucina' sobre fatos recentes
- O conhecimento do Magistral Small fica limitado à data de treinamento. Para perguntas factuais que exigem informações atualizadas (jurisprudência recente, notícias), é necessário um pipeline RAG, não apenas o modelo isolado.
#Para se aprofundar
Magistral é um excelente modelo em francês para quem tem GPU. Algumas dicas para explorar ao máximo sua instalação:
- Comparar com DeepSeek R1 em sua máquina
- O guia de instalação do DeepSeek R1 mostra como instalar a versão destilada de 14B em paralelo com o Magistral para testar os dois lado a lado com seus próprios prompts.
- Conectar Magistral aos seus PDFs jurídicos
- O guia PrivateGPT v2 descreve um pipeline RAG 100% local que complementa perfeitamente Magistral para análise documental confidencial.
- Escolher a quantização mais adequada
- Se você tiver dúvidas entre Q4_K_M, Q5_K_M ou Q6_K, o guia "Escolher a quantização" apresenta as vantagens e desvantagens de cada opção. Em um modelo de raciocínio, as perdas de quantização são mais evidentes do que em um modelo geral.
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.