Melhor LLM open-source para o setor médico em 2026
Escolher um LLM médico de código aberto em 2026 exige equilibrar a confidencialidade dos dados dos pacientes, a precisão clínica e o orçamento para GPU. O LLM médico de código aberto auto-hospedado continua sendo a opção preferencial para manter a conformidade com o RGPD e o sigilo profissional, sem enviar prontuários para uma API de terceiros. Este guia analisa os modelos com pesos abertos mais pertinentes para usos em saúde (síntese de relatórios, codificação CID-10, auxílio no diagnóstico diferencial, pesquisa bibliográfica), com especificações de VRAM, licenças e benchmarks verificáveis.
Por que usar um modelo auto-hospedado para a saúde
Os dados pessoais de saúde estão sujeitos ao artigo 9 do RGPD e exigem hospedagem HDS na França. Uma API em nuvem, mesmo criptografada, expõe o consultório ou o hospital a uma transferência para fora da UE e complica a auditoria. A auto-hospedagem de um modelo com pesos abertos em GPU local ou servidor nas próprias instalações elimina esse risco.
O segundo argumento é a rastreabilidade. Um modelo com pesos armazenados localmente (pesos fixos, prompt de sistema versionado) produz saídas reprodutíveis, ao contrário de um endpoint proprietário cujos pesos podem mudar sem aviso prévio. Para um LLM para diagnóstico utilizado como apoio à decisão médica, essa reprodutibilidade é exigida para qualificar o dispositivo nos termos do regulamento MDR 2017/745.
O projeto MedGemma do Google Health, frequentemente citado como referência, ilustra a abordagem: pesos abertos, fine-tuning em corpus médicos públicos (MIMIC, PubMed), avaliação transparente. Para um panorama mais amplo das famílias disponíveis, veja nosso catálogo completo dos 249 modelos indexados.
Famílias de modelos adaptadas aos usos clínicos
Nenhum modelo generalista é oficialmente homologado como dispositivo médico em 2026. A escolha é feita com base na qualidade do raciocínio médico, medida pelos benchmarks MedQA, MedMCQA, PubMedQA e MMLU-Medical, combinada com as limitações de hardware.
Modelos de raciocínio (diagnóstico diferencial, síntese de casos)
- DeepSeek R1 671B (671B, MIT) — VRAM Q4 ~400 GB, ctx 128 000. O raciocínio em cadeia nativo ajuda em casos complexos. Pontuações MedQA estimadas em torno de 88% em pass@1.
- DeepSeek R2 32B (32B, MIT) — VRAM Q4 ~19 GB, ctx 128 000. Versão destilada que roda em uma única RTX 5090, adequada para um consultório ou um serviço hospitalar.
- QwQ 32B (32B, Apache 2.0) — raciocínio longo, contexto de 131 072 tokens. Desempenho MMLU-Medical a ser confirmado após avaliação independente.
- DeepSeek R1 Distill 32B (32B, MIT) — alternativa leve para unidades sem GPU H100.
Modelos generalistas sólidos para a saúde
- Llama 3.3 70B Instruct (70B, Llama 3.3 Community) — VRAM Q4 ~40 GB. Bem documentado na literatura médica em francês, base frequente para fine-tuning.
- Mistral Large 3 675B (675B, Apache 2.0) — fornecedor europeu com sede em Paris, contexto de 256.000 tokens útil para processar um dossiê completo.
- Mistral Small 4 (119B, Apache 2.0) — VRAM Q4 ~72 GB, bom equilíbrio para um servidor com 2× A100 de 80 GB.
- Qwen 3 235B-A22B (235B MoE, Apache 2.0) — arquitetura mixture-of-experts, 22 bilhões de parâmetros ativos, latência aceitável.
- gpt-oss 120B (117B, Apache 2.0) — modelo aberto da OpenAI, ctx 128.000.
Modelos multimodais para imagens e relatórios escaneados
- Qwen 3 VL 235B-A22B (235B, Apache 2.0) — visão-linguagem, ctx 262 144. Permite ler relatórios PDF escaneados ou gráficos.
- LLaVA-OneVision 72B (72B, Apache 2.0) — alternativa acadêmica documentada no arXiv.
- Molmo 72B (72B, Apache 2.0) — visão de código aberto daAllen AI.
VRAM, quantização e hardware-alvo
O dimensionamento do hardware condiciona qualquer implantação deIA local para a saúde. Os valores abaixo referem-se à inferência, sem incluir lotes de treinamento.
Para uma estação de trabalho de uso individual (consultório particular, médico pesquisador) : - Qwen 3.6 35B-A3B — Q4 ~21 GB, cabe em uma RTX 5090 32 GB - Granite 4.0 H-Small 32B-A9B — Q4 ~19 GB, licença Apache 2.0 da IBM Research - Gemma 4 31B — Q4 ~18 GB, licença Gemma (ler antes da implantação clínica) - Seed-OSS 36B Instruct — ctx 524 288, útil para ingerir vários prontuários
Para um serviço hospitalar (1 a 2 servidores DGX ou H100) : - Llama 4 Scout 109B — Q4 ~65 GB, contexto de 10 milhões de tokens (a confirmar em produção) - Mistral Small 4 — Q4 ~72 GB - Qwen 3.5 122B-A10B — Q4 ~73 GB - Mixtral 8x22B Instruct — Q4 ~82 GB, opção confiável para redação médica
Para um hospital ou editor de saúde (cluster de múltiplos nós) : - DeepSeek V3.2 — Q4 ~410 GB - GLM-5.1 — Q4 ~445 GB, ctx 200 000 - Mistral Large 3 675B — Q4 ~405 GB
As estimativas para Q5 acrescentam ~25%, e as de FP16 dobram esses volumes. Para refinar a estimativa, use o configurador de GPU que leva em conta o KV-cache com contexto completo.
Licenças: o que viabiliza o uso clínico e o que o impede
A licença determina se você pode integrar o modelo a um produto pelo qual uma instituição de saúde paga.
- Apache 2.0 (Mistral, Qwen, IBM Granite, gpt-oss, Mixtral): uso comercial livre, modificações permitidas, licenças de patentes concedidas. A via mais simples para um dispositivo médico.
- MIT (DeepSeek, MiMo, Ring-1T, GLM) : equivalente na prática, sem cláusula de patente explícita.
- Llama 3 / 3.3 / 4 Community : uso comercial autorizado abaixo do limite de 700 milhões de usuários ativos mensais, restrições a certos usos militares. Ler a licença oficial da Meta antes do deploy.
- Gemma (Google): proíbe certos usos, cláusula de atualização unilateral das restrições. Mais delicado para um produto médico certificado.
Para atores europeus preocupados com soberania, Mistral Large 3 675B, Apertus 70B (Swiss AI) e Salamandra 40B Instruct (Barcelona Supercomputing Center) oferecem pesos que podem ser hospedados integralmente na UE. Compare essas opções na página Mistral vs Llama.
Benchmarks médicos: o que os números significam
Os benchmarks médicos públicos mais usados em 2026:
- MedQA (USMLE) : questões de múltipla escolha no estilo do exame médico americano. Referência histórica, ver o artigo original no arXiv.
- MedMCQA : questionário indiano de múltipla escolha, ampla cobertura das especialidades.
- PubMedQA : raciocínio sobre resumos do PubMed.
- MMLU-Medical : subconjunto médico do MMLU.
- MultiMedQA : agregado publicado por Google Research.
As pontuações MedQA dos modelos generalistas em pass@1 (estimativas provenientes das fichas dos modelos no HuggingFace e de artigos técnicos, a confirmar para uso crítico):
- DeepSeek R1 671B : ~88 %
- Llama 3.3 70B : ~82 %
- Mixtral 8x22B : ~78 %
- Qwen 3 32B : ~80 % (estimado)
Para a programação de ferramentas de pipeline biomédico (parsing de FHIR, scripts de extração de imagens DICOM), Qwen 2.5 Coder 32B ou Qwen3-Coder-Next 80B-A3B atingem pontuações HumanEval superiores a 85 %.
Atenção : uma pontuação alta no benchmark MedQA não equivale a uma autorização para comercialização. Um dispositivo médico da classe IIa ou superior exige validação clínica de acordo com a norma IEC 62304 e o regulamento MDR.
Casos de uso práticos e pipeline recomendado
Síntese de relatório cirúrgico : Mistral Small 4 ou Llama 3.3 70B, contexto 128 000 tokens. Prompt estruturado solicitando um resumo SOAP. Veja nosso guia de fine-tuning na área da saúde.
Auxílio na codificação CIM-10 e CCAM : Granite 4.0 H-Small com base RAG na nomenclatura oficial. IBM publica avaliações sobre seu hub Granite.
Busca bibliográfica no PubMed : Qwen 3 VL 235B-A22B para ler as figuras, combinado com um índice vetorial. Veja o guia RAG médico.
Ajuda no diagnóstico diferencial : DeepSeek R1 671B ou DeepSeek R2 32B para o raciocínio passo a passo. Sempre com validação humana, como assistente e não como substituto.
Teleconsulta e transcrição : combinar Whisper-large-v3 (repositório OpenAI) primeiro, depois Mistral Large 3 para a formatação.
Para comparar com outros setores, consulte melhor LLM jurídico ou Melhor LLM para código.
FAQ
P: MedGemma está listado no QualLLM?
MedGemma ainda não está no catálogo dos 249 modelos indexados, pois as variantes especializadas em saúde são acompanhadas separadamente. Para uma implantação imediata, Gemma 4 31B serve de base sob a licença Gemma, para fazer fine-tuning com um corpus interno. A família MedGemma é documentada pelo Google Health no HuggingFace e permanece compatível com um servidor vLLM padrão.
P: Qual a VRAM mínima para uso clínico individual?
Conte com 20 a 24 GB para rodar um modelo 32B em Q4 com contexto de 32 000 tokens úteis. Uma RTX 5090 32 GB, uma RTX 6000 Ada 48 GB ou um Mac Studio M3 Ultra 96 GB são adequados. Abaixo de 16 GB, você está limitado a modelos 7B-13B, cuja qualidade médica é considerada insuficiente para uso profissional.
P: É possível implantar um LLM médico de código aberto em produção sem certificação?
Para uso interno de auxílio na redação, sem intervenção na decisão médica, sim. A partir do momento em que um módulo influencia um diagnóstico, uma prescrição ou uma triagem de pacientes, você entra no âmbito do regulamento MDR 2017/745. A documentação ANSM sobre dispositivos médicos digitais especifica os limites.
P: Qual a diferença entre DeepSeek R1 e R2 para a saúde?
DeepSeek R1 671B permanece a referência em raciocínio longo e profundidade enciclopédica, mas exige ~400 GB de VRAM. DeepSeek R2 32B é uma versão destilada que roda em uma única GPU, com cerca de 90% do desempenho no MedQA segundo os relatórios técnicos disponíveis (a confirmar).
P: Os modelos chineses representam um risco para os dados dos pacientes?
Os pesos abertos (DeepSeek, Qwen, GLM, MiMo) rodam localmente sem envio de telemetria. O risco não é a exfiltração, mas o viés cultural em relação a patologias, posologia e protocolos. É necessária uma avaliação interna com casos em língua francesa. Compare com Mistral vs DeepSeek.
P: Qual modelo para transcrição médica em francês?
Para a transcrição bruta, Whisper-large-v3 continua sendo a referência. Para transformar a transcrição literal em um relatório, Mistral Small 4 ou Llama 3.3 70B produzem um francês médico natural. Adicione um prompt de sistema que especifique a especialidade em questão.
Conclusão
A escolha de um LLM médico de código aberto em 2026 depende principalmente do equipamento disponível e do contexto regulatório pretendido. Para um consultório, DeepSeek R2 32B ou Granite 4.0 H-Small são suficientes. Para um hospital universitário, Mistral Large 3 675B ou DeepSeek R1 671B abrangem casos complexos. Aperfeiçoe sua escolha com o configurador de GPU ou navegue pelo catálogo completo filtrado por licença e VRAM.