Intermediário 11 minSaúde

Saúde: transcrição de consultations

Resposta direta

Sim: Whisper (faster-whisper) transcreve o áudio e um LLM local redige o relatório, sem que nada saia do computador do médico. O processamento local não elimina as obrigações: sigilo profissional, informação ao paciente com direito de oposição, consentimento para a gravação da voz, provedor de hospedagem HDS se um terceiro armazenar os dados e revisão pelo próprio médico.

Um médico que redige seus relatórios à noite pode economizar tempo com um fluxo local de áudio, transcrição e, depois, relatório estruturado. Você saberá montar esse fluxo, conhecer suas limitações (alucinações, contexto truncado) e respeitar as regras estabelecidas pela HAS, pela CNIL e pela Ordem dos Médicos, corrigindo várias ideias equivocadas.

Por Mohamed Meguedmi·Atualização 2026-09-30·Testado no Windows, macOS e Linux

#Transcrever uma consulta localmente: o que é permitido e sob quais condições

Sim, um médico pode transcrever suas consultas com IA sem que o áudio saia do seu computador: o Whisper transcreve a voz, um LLM local (via Ollama) redige um relatório estruturado e o profissional revisa e valida. Isso não elimina as obrigações legais. O guia da HAS e da CNIL de 2026 lembra que a introdução de um sistema de IA não altera as regras de sigilo profissional previstas no artigo L. 1110-4 do Código de Saúde Pública. Também é necessário informar o paciente e respeitar seu direito de oposição. A hospedagem por terceiros exige um provedor de hospedagem certificado HDS. O processamento local evita justamente essa transferência e seus riscos. Este guia monta o pipeline e, em seguida, detalha o marco legal e as verificações indispensáveis, corrigindo algumas ideias equivocadas.

A transcrição automática de consultas é, segundo esse mesmo guia, o caso de uso mais frequente das IAs generativas em contextos de atendimento à saúde. Portanto, a questão não é saber se é possível fazer isso, mas como fazê-lo corretamente.

!
Este guia não é um parecer jurídico
Os aspectos jurídicos são os apresentados nos guias publicados pela HAS, pela CNIL e pelo Conselho Nacional da Ordem dos Médicos. Para sua situação (atuação individual, centro de saúde, estabelecimento), peça ao seu DPO ou ao órgão competente da ordem profissional que valide o dispositivo.

#O contexto francês: o que dizem os guias oficiais

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

A tabela apresenta cada exigência com seu efeito concreto em um pipeline local. Ela corrige ao mesmo tempo dois mitos comuns: o consentimento do paciente não é a base legal do tratamento e o HDS não é exigido por princípio, mas apenas quando um terceiro hospeda os dados.

Requisitos e consequências para um pipeline local
TemaO que dizem os guiasConsequência prática
Sigilo profissionalA IA não muda as regras do artigo L. 1110-4 do CSPO relatório continua sujeito ao sigilo; limite o acesso ao computador
HospedagemUm terceiro que hospeda dados de saúde (nuvem) deve ser certificado como prestador de serviços de hospedagem de dados de saúdeProcessamento no computador do médico: nenhum provedor de hospedagem terceirizado no fluxo
Base legalA CNIL considera que o consentimento não é nem a base legal nem a exceção para esses tratamentosDocumente a base escolhida com seu DPO; não conte com uma caixa de seleção marcada
InformaçãoUma informação transparente e acessível, com direito de oposição, é suficiente na maioria dos casos.Exiba um aviso ou informe verbalmente que a consulta está sendo transcrita; respeite a recusa.
Gravação vocalO uso de gravações de voz que permitem identificar uma pessoa está sujeito ao consentimento nos termos do Código CivilObtenha o consentimento do paciente antes de gravar a voz
Validação do relatórioNão deveria ser validado por um terceiro ausente da consulta, como uma secretáriaO próprio médico que atendeu o paciente faz a releitura
ConservaçãoO Conselho da Ordem recomenda 20 anos após a última consulta, na ausência de uma norma específica para o exercício profissional autônomoO relatório segue esse prazo; não há motivo para guardar o áudio bruto

#Duas ideias equivocadas a abandonar

Primeira ideia equivocada: “ChatGPT está formalmente proibido”. Os textos não visam nenhuma ferramenta em particular. O problema é estrutural: enviar dados de saúde para um serviço online faz com que eles saiam do seu computador, o que exige um provedor de hospedagem certificado, um contrato de subcontratação e informações adequadas. O guia da HAS e da CNIL também identifica um risco de violação do sigilo médico relacionado à inclusão de dados sensíveis nas solicitações aos agentes conversacionais online.

Segunda ideia equivocada: "local significa estar em conformidade". O processamento local elimina a transferência, mas não a obrigação de manter um registro, informar os pacientes, proteger a estação de trabalho e avaliar a necessidade de uma análise de impacto. O guia inclui a avaliação de impacto sobre a proteção de dados (AIPD) entre as obrigações do responsável pela implantação, quando aplicável: busque orientação para decidir sobre esse ponto, assim como sobre a possível classificação da sua ferramenta como dispositivo médico.

#A stack: Whisper, um LLM local e, opcionalmente, a diarização

Os blocos do pipeline
BlocoFunçãoO que você precisa saber
faster-whisperTranscreve áudio (implementação CTranslate2 do Whisper)Anunciado como até quatro vezes mais rápido que a implementação original, com a mesma precisão
Modelo large-v3Modelo multilíngue da família Whisper, com francês incluídoBaixado no primeiro uso; a validar com suas próprias gravações
Ollama + qwen3.5:9bRedige o relatório estruturadoModelo com 9 bilhões de parâmetros; 6,6 GB de acordo com a biblioteca Ollama
pyannote (opção)Diarização: quem fala quandoModelo para download com um token do Hugging Face após aceitação de seus termos

Em termos de velocidade, a documentação do faster-whisper fornece uma referência datada: 13 minutos de áudio transcritos em 1 minuto e 3 segundos com o modelo large-v2 em fp16, consumindo 4.525 MB de VRAM, em uma RTX 3070 Ti de 8 GB (benchmark dos mantenedores, CUDA 12.4). Os mesmos mantenedores registraram 59 segundos para 2.926 MB em int8. São as medições deles, na máquina deles, não as nossas: elas indicam que uma placa de vídeo modesta transcreve mais rápido que o tempo real, sem que isso seja uma promessa para o seu computador.

i
No Mac, não há CUDA
O exemplo oficial do faster-whisper mostra a execução no processador em int8. Essa é a configuração a adotar em um Mac: mais lenta que uma GPU NVIDIA, mas suficiente para uma transcrição posterior, após a consulta.

#Instalação

Terminal
python3 -m venv venv
source venv/bin/activate

pip install faster-whisper ollama
# Optionnel pour la diarisation :
pip install pyannote.audio
Terminal
# Le modèle Whisper se télécharge au premier usage.
# Modèle de rédaction via Ollama :
ollama pull qwen3.5:9b

Com uma GPU NVIDIA, o faster-whisper exige as bibliotecas cuBLAS e cuDNN 9 para CUDA 12. Sem elas, o programa falha ao carregar o modelo: instale-as antes de testar ou passe para o modo CPU.

#Transcrever áudio

O script abaixo define o idioma, ativa o filtro de silêncio (VAD) e adiciona marcações de tempo a cada segmento. Ajuste a primeira linha: device cuda com float16 para uma GPU NVIDIA, device cpu com int8 para um Mac ou um PC sem placa compatível.

Python
from faster_whisper import WhisperModel

# GPU NVIDIA : device="cuda", compute_type="float16"
# Sans GPU compatible : device="cpu", compute_type="int8"
model = WhisperModel("large-v3", device="cuda", compute_type="float16")

MOTS_CLES = "amoxicilline, paracétamol, HbA1c, tension artérielle"

def transcribe(audio_path):
    segments, info = model.transcribe(
        audio_path,
        language="fr",
        beam_size=5,
        vad_filter=True,        # coupe les silences
        hotwords=MOTS_CLES,     # vocabulaire attendu
        word_timestamps=False,
    )
    lines = []
    for s in segments:
        ts = f"[{int(s.start // 60):02d}:{int(s.start % 60):02d}]"
        lines.append(f"{ts} {s.text.strip()}")
    return "\n".join(lines)

if __name__ == "__main__":
    import sys
    print(transcribe(sys.argv[1]))

O parâmetro hotwords, exposto pela função de transcrição do faster-whisper, permite sugerir ao modelo termos esperados: nomes de medicamentos, siglas, exames. Ele ajuda, mas não garante: revise sempre os nomes próprios e as doses.

#Whisper pode escrever o que ninguém disse

A descrição do modelo large-v3 avisa que as previsões podem conter textos que não estão no áudio, o que ela chama de 'alucinação'. Em uma consulta, isso pode gerar uma frase plausível inventada em um silêncio, um número modificado ou um nome de medicamento semelhante mas incorreto. O filtro VAD reduz o risco em silêncios; ele não substitui a revisão.

#Redigir o relatório estruturado

O segundo script envia a transcrição a um modelo local pela API do Ollama. Dois ajustes são importantes: uma temperatura baixa para limitar invenções e uma janela de contexto suficiente. A documentação do Ollama indica uma janela padrão de cerca de 4.000 tokens quando há menos de 24 GiB de VRAM. Uma consulta de vinte minutos representa cerca de 3.000 palavras, ou seja, vários milhares de tokens (estimativa que varia conforme a velocidade da fala): sem num_ctx explícito, o final da transcrição corre o risco de ser truncado. Por isso, o exemplo define 16.384 tokens.

Python
import requests

SYSTEM_CR = """Tu es un assistant pour médecin généraliste français.
À partir d'une TRANSCRIPTION BRUTE d'une consultation, tu produis un
compte-rendu médical structuré.

FORMAT DE SORTIE :
## Motif de consultation
## Antécédents (mentionnés)
## Examen clinique
## Diagnostic / Hypothèses
## Traitement / Prescriptions
## Suivi

RÈGLES :
- Reste TEXTUEL : n'ajoute aucun élément non mentionné dans la transcription.
- Reformule en vocabulaire médical standard.
- Si une section n'est pas abordée, écris "Non mentionné".
- Ne complète jamais une posologie ou un diagnostic absent.
"""

def summarize(transcription):
    r = requests.post("http://localhost:11434/api/chat", json={
        "model": "qwen3.5:9b",
        "messages": [
            {"role": "system", "content": SYSTEM_CR},
            {"role": "user",   "content": transcription},
        ],
        "stream": False,
        "options": {"temperature": 0.2, "num_ctx": 16384},
    })
    return r.json()["message"]["content"]

Este prompt aplica os princípios do guia sobre system prompts: regras verificáveis, formato de saída explícito, comportamento previsto quando a informação estiver ausente. A instrução "Não mencionado" é importante: evita que o modelo preencha uma seção vazia com uma hipótese plausível.

#Diarização: diferenciar médico e paciente

A diarização atribui cada segmento a um falante (SPEAKER_00, SPEAKER_01). Ela é principalmente útil quando você grava a consulta em si, com duas vozes; para um ditado feito apenas pelo médico, é desnecessária. O repositório do pyannote recomenda atualmente o pipeline community-1: é necessário aceitar seus termos de uso no Hugging Face e criar um token de acesso para baixá-lo. A inferência é executada localmente em seguida.

Python
import torch
from pyannote.audio import Pipeline

pipeline = Pipeline.from_pretrained(
    "pyannote/speaker-diarization-community-1",
    token="HUGGINGFACE_ACCESS_TOKEN",
)
pipeline.to(torch.device("cuda"))  # si un GPU est disponible

output = pipeline("consultation.wav")
for turn, speaker in output.speaker_diarization:
    print(f"{turn.start:.1f}s - {turn.end:.1f}s : {speaker}")
→
Combinar os dois resultados
Para um relatório com duas vozes, alinhe os segmentos do Whisper e do pyannote pelos respectivos timestamps antes de enviar o texto ao LLM. O guia sobre WhisperX descreve uma ferramenta que faz esse alinhamento palavra por palavra.

#Fluxo de trabalho típico em consultório

  1. 01
    Informar o paciente
    Antes da gravação, informe que a consulta ou o ditado será transcrito por uma ferramenta local e que o paciente pode se opor a isso. Se você gravar a voz do paciente, obtenha seu consentimento. Registre essa informação no prontuário.
  2. 02
    Gravar
    Duas opções: ditar de 1 a 2 minutos de anotações após a consulta (o paciente já não está sendo gravado), ou gravar a conversa (consentimento verbal exigido, diarização útil). O ditado minimiza os dados coletados.
  3. 03
    Transferir o arquivo para o computador
    Transfira o áudio (WAV, MP3, M4A) para um diretório dedicado, criptografado. Um pequeno script monitora o diretório e aciona o processamento.
  4. 04
    Iniciar o pipeline
    O script transcreve, resume, salva o relatório em formato de texto junto ao arquivo de áudio e registra a operação em log sem incluir conteúdo médico nesse registro.
  5. 05
    Reler e validar pessoalmente
    O médico que atendeu o paciente relê o relatório, faz as correções e depois o integra ao seu software de gestão do consultório. Uma terceira pessoa que não esteve presente na consulta não consegue identificar as alucinações.
  6. 06
    Remover áudio bruto
    Após a validação do relatório, exclua o áudio e a transcrição intermediária: esses dados não têm mais finalidade, e o relatório acompanha o prontuário médico.

#O que verificar na revisão

Tabela de revisão de um relatório gerado
ElementoRiscoVerificação
Medicamentos e dosagensNome semelhante, unidade ou posologia alteradaComparar com a prescrição real
AntecedentesAntecedente inventado ou atribuído ao paciente erradoComparar com o prontuário
Negações« Sem febre » tornou-se « febre »Reler as frases negativas
Seções vaziasHipótese plausível substituindo 'Não mencionado'Verificar se nenhuma lacuna foi preenchida
Datas e duraçõesDuração do tratamento ou prazo de acompanhamento incorretoConferir com o que foi dito
Registro das atividades de tratamento
O guia da CNIL e da Ordem dos Médicos solicita que você mantenha um registro das atividades de tratamento; adicione a ele uma linha descrevendo esse pipeline local e suas finalidades.
Prazo de retenção
O relatório segue o prazo de conservação do prontuário médico (20 anos após a última consulta, conforme a recomendação do conselho profissional). O áudio bruto, que deixa de ser necessário após a validação do relatório, deve ser excluído.
Criptografia e backups
Criptografe o disco (FileVault, BitLocker, LUKS) e faça backups regularmente em uma mídia criptografada guardada fora do consultório. Um computador roubado com dados de saúde sem criptografia constitui uma violação de dados.
Rastreabilidade
Mantenha um registro de que o paciente foi informado, da versão das ferramentas e da validação do médico: esses são seus elementos de comprovação em caso de fiscalização.
FAQ
É possível transcrever uma consulta médica com IA?+
Sim, desde que as regras aplicáveis sejam respeitadas: o sigilo profissional continua valendo, o paciente deve ser informado e poder se opor, a gravação de sua voz exige seu consentimento e o relatório deve ser revisado pelo médico. O processamento local evita a transferência para um provedor de hospedagem terceirizado, sem dispensar as demais obrigações.
É necessário o consentimento do paciente para transcrever sua consulta?+
Para o processamento de dados, a CNIL considera que o consentimento não é a base legal nem a exceção: a prestação de informações e o direito de oposição são suficientes em princípio. Por outro lado, a gravação da voz de uma pessoa identificável depende de seu consentimento nos termos do Código Civil. Ditar suas anotações após a consulta evita essa questão.
É obrigatório um provedor de hospedagem HDS para um pipeline local?+
A obrigação se aplica aos dados de saúde confiados a um terceiro que os hospeda, por exemplo em nuvem. Um processamento realizado no computador do médico, sem transferência, não inclui no fluxo um terceiro responsável pela hospedagem. Se você adicionar uma cópia de segurança remota ou um serviço online, a questão volta a surgir.
O Whisper é confiável para o vocabulário médico francês?+
Whisper large-v3 é o modelo de referência da família, mas sua ficha indica que ele pode gerar textos ausentes do áudio. Nomes de medicamentos, siglas e dosagens são pontos frágeis. O parâmetro hotwords ajuda, a revisão continua indispensável, e ninguém deve validar no lugar do médico.
Uma secretária médica pode validar o relatório gerado?+
O guia HAS e CNIL recomenda que o relatório não seja validado por um terceiro ausente da consulta, pois ele não será capaz de detectar as alucinações. É o médico que examinou o paciente quem revisa e valida. A secretária pode, em seguida, classificar ou integrar o documento.
Qual configuração para rodar esse pipeline?+
Uma GPU NVIDIA com 8 GB de VRAM transcreve mais rápido que o tempo real segundo as medições do faster-whisper, e um modelo de redação com 9 bilhões de parâmetros exige 6,6 GB de acordo com a biblioteca Ollama. Sem GPU, o modo de execução na CPU em int8 funciona, mas mais lentamente: planeje um processamento posterior.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.