Kokoro TTS: uma voz local convincente e leve
Kokoro (hexgrad/Kokoro-82M, licença Apache 2.0) é um modelo aberto de síntese de voz com 82 milhões de parâmetros, baseado em StyleTTS 2 e ISTFTNet. Ele abrange 8 idiomas e 54 vozes (incluindo o francês), roda mais rápido que o tempo real no processador e foi treinado exclusivamente com áudio livre de direitos — sem possibilidade de clonagem, pois nenhum módulo de clonagem foi publicado. Custo observado via API: menos de US$ 1 por milhão de caracteres.
A maioria dos bons sistemas de síntese de voz roda na nuvem ou exige hardware potente. Kokoro é um modelo aberto (repositório hexgrad/Kokoro-82M, licença Apache 2.0) de tamanho muito pequeno, com um resultado convincente, que gera áudio mais rápido que o tempo real em uma máquina comum — inclusive sem placa de vídeo. Sua ficha técnica é excepcionalmente precisa sobre o que contém, inclusive sobre a origem dos dados de treinamento, o que faz do Kokoro um caso raro de modelo de voz cujas afirmações podem ser verificadas uma a uma, em vez de simplesmente serem aceitas sem comprovação.
#Por que um modelo pequeno muda o cálculo
A qualidade da síntese vocal já não é mais um problema há algum tempo; o custo e a localização, sim. As vozes online soam muito bem e implicam que cada frase pronunciada pelo seu sistema seja enviada para um prestador e cobrada por uso. Os grandes modelos locais soam bem e ocupam uma placa gráfica que você preferiria dar ao seu modelo de linguagem em vez da voz que o faz falar.
Um modelo pequeno o suficiente para rodar em um segundo em um processador elimina as duas restrições de uma vez. Ler um documento longo em voz alta deixa de ser uma decisão orçamentária. Um assistente pode pronunciar todas as suas respostas, em vez de apenas as respostas importantes. Um processamento em lote pode narrar cem arquivos durante a noite no equipamento que você já possui, sem enviar nada a terceiros, sem esperar por uma cota nem monitorar uma fatura que aumenta com o volume processado.
#O modelo, em números verificados
Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.
- Espaço online vitalício
- PDF + arquivos
- Atualizações vitalícias
- 82 milhões de parâmetros
- Uma ordem de grandeza abaixo dos modelos com os quais ele costuma ser comparado.
- Arquitetura StyleTTS 2 + ISTFTNet
- Uma arquitetura “somente decodificador”, sem difusão, o que explica em parte sua leveza.
- 8 idiomas, 54 vozes (v1.0)
- Publicada em 27 de janeiro de 2025, treinada com algumas centenas de horas de áudio.
- Custo total de treinamento: cerca de $ 1.000
- 1.000 horas de cálculo em GPU A100 de 80 GB ao todo, um orçamento minúsculo para esse resultado em comparação com os modelos concorrentes.
- Dados exclusivamente livres de direitos
- Áudio de domínio público, sob licenças permissivas, ou áudio sintético de fornecedores comerciais fechados — explicitamente, nunca clones de voz não autorizados nem áudio de outro modelo aberto.
Esse último ponto merece destaque: a ficha do modelo é explícita sobre a origem dos dados, o que é raro nesse campo. É uma das razões pelas quais o Kokoro pode ser implantado sem a indefinição jurídica que envolve modelos treinados com vozes obtidas ou clonadas sem autorização — um ponto especialmente relevante para um projeto voltado ao público em geral na França, onde o direito à imagem associado à voz é levado a sério. Quando foi lançado, o Kokoro conquistou o primeiro lugar no ranking comunitário TTS Spaces Arena, à frente de modelos significativamente maiores: XTTS v2 (467 milhões de parâmetros), MetaVoice (1,2 bilhão) e Fish Speech (cerca de 500 milhões) foram todos superados por um modelo de 82 milhões — um ranking de uma época específica, não uma garantia universal, mas um forte sinal da relação qualidade/tamanho para quem precisa escolher rapidamente sem executar dez modelos em paralelo.
#O que faz e o que não faz
| Capacidade | Kokoro |
|---|---|
| Prosódia natural em textos comuns em prosa | Sólido para o seu tamanho |
| Vozes predefinidas | 54 vozes distribuídas em 8 idiomas, incluindo o francês (fr-fr) |
| Clonagem de voz a partir de uma amostra | Isso não é seu objetivo: nenhum módulo de clonagem foi publicado com os pesos |
| Controle preciso da expressão emocional | Limitado |
| Velocidade | Mais rápido que o tempo real em hardware modesto |
| Funcionamento offline | Sim, após os pesos serem baixados via pip install kokoro |
Uma descrição honesta: é um ótimo leitor, não um ator. Para narração, notificações, um assistente ou acessibilidade, é mais do que suficiente. Para um trabalho de interpretação em que uma intenção específica importa, você precisará de uma ferramenta que permita um direcionamento mais preciso. Quanto ao orçamento, o preço observado via API gira em torno de US$ 1 por milhão de caracteres de entrada — cerca de mil caracteres para um minuto de áudio gerado —, uma referência útil mesmo no uso local, para comparar com o custo real de uma assinatura equivalente na nuvem ao longo do tempo.
#Sua posição em uma cadeia local
- 01A voz entraUm modelo de transcrição converte a fala do usuário em texto; o Faster-Whisper cobre bem esse passo, mesmo sem GPU.
- 02O modelo pensaUm modelo local gera a resposta, com o Ollama ou outro motor fornecendo acesso ao modelo.
- 03A voz saiO Kokoro lê a resposta por meio do pacote Python kokoro, que se baseia na biblioteca de fonetização misaki e no espeak-ng como alternativa para algumas palavras fora do dicionário.
O orçamento de latência deve sempre ser considerado como um todo: o usuário percebe o tempo total — primeiro a transcrição, depois a geração e, por fim, a síntese. A síntese geralmente é a etapa menos custosa das três, o que significa que a rapidez de resposta percebida de um assistente de voz é determinada principalmente pela velocidade do seu modelo de linguagem, e não pela voz que lê a resposta final.
#Três usos concretos em francês
A voz fr-fr do Kokoro torna o modelo diretamente utilizável para um público de língua francesa, sem recorrer a uma voz inglesa com sotaque inadequado nem a um serviço de terceiros cobrado por uso. Três casos aparecem com mais frequência nos projetos que o adotam.
- Leitura de documentos longos
- Relatórios, artigos, notas de acompanhamento: narrar um documento de várias páginas custa apenas um pouco de tempo de processamento, em vez de uma assinatura de uma API cobrada por caractere.
- Assistente de voz doméstico ou profissional
- Combinado com Whisper para reconhecimento de voz e com um LLM local para reflexão, Kokoro fecha o ciclo sem que nenhuma conversa saia da rede local.
- Acessibilidade e notificações
- Leitura de tela, alertas vocais, confirmação de ações: usos em que a latência e a disponibilidade offline são mais importantes do que a nuance de interpretação.
Nos três casos, a lógica orçamentária muda de natureza: em vez de um custo por caractere cobrado a cada chamada, o gasto passa a ser a eletricidade e o tempo de processamento de uma máquina que você já possui. Para um volume elevado de texto lido em voz alta — do monitoramento documental diário a um serviço de atendimento ao cliente por voz — a diferença cresce rapidamente a favor da execução local, especialmente porque a geração continua mais rápida que o tempo real, mesmo sem placa de vídeo dedicada.
#Kokoro ou Piper
| Kokoro | Piper | |
|---|---|---|
| Qualidade da saída | Superior, prosódia mais natural | Boa, mais monótona |
| Tamanho | 82 milhões de parâmetros, um único modelo | Muito pequeno, um modelo ONNX por voz (VITS) |
| Velocidade no processador | Rápido | Extremamente rápido, projetado para hardware com recursos muito limitados |
| Cobertura linguística | 8 idiomas, 54 vozes (v1.0) | 44 idiomas/localidades na lista oficial de vozes |
| Licença | Apache 2.0, licença única para todas as vozes | GPL-3.0 no repositório ativo; MIT no antigo repositório, agora arquivado |
| Escolha quando | A qualidade é prioridade | O consumo de recursos, a latência ou uma voz de uma localidade linguística específica têm prioridade |
A questão da licença do Piper merece ser verificada antes de se comprometer: o repositório histórico rhasspy/piper, sob licença MIT, está agora arquivado e em modo somente leitura. O desenvolvimento ativo foi transferido para OHF-Voice/piper1-gpl, mantido pela Open Home Foundation sob licença GPL-3.0 — uma diferença real para uso comercial em comparação com os tutoriais que ainda citam a licença MIT do repositório antigo. A documentação oficial do Piper acrescenta que algumas vozes individuais podem ter licenças mais restritivas do que a do motor: verificar voz por voz, não apenas no nível do projeto. O Piper continua sendo estruturado de forma diferente do Kokoro: cada voz é um modelo VITS distinto exportado em ONNX, com um arquivo .onnx e um arquivo .onnx.json de configuração, enquanto o Kokoro oferece suas 54 vozes a partir de um único conjunto de pesos compartilhados.
- Assistente vocal local: Whisper + Ollama + Piper, de ponta a ponta
- A etapa de escuta: transcrever rapidamente em ambiente local, mesmo sem GPU
- Vosk: outra opção para reconhecimento de fala offline
- Automatizar um relatório de reunião localmente
- Fonte: ficha oficial Kokoro-82M no Hugging Face
- Fonte: repositório GitHub do pacote Python kokoro
- Fonte: repositório ativo do Piper (GPL-3.0)
#Licença e ética
Duas questões determinam se um modelo de síntese de voz pode ser usado no seu projeto, e apenas uma é técnica. A primeira é a licença dos pesos e das vozes, que rege o uso comercial: no caso do Kokoro, é a Apache 2.0, uma licença permissiva e sem ambiguidades que cobre todas as 54 vozes — não é o caso de todos os motores, sendo o Piper o exemplo mais próximo, com sua recente mudança para a GPL-3.0. A segunda é que um modelo com vozes predefinidas evita completamente a questão do consentimento, enquanto clonar a voz de alguém a partir de uma amostra exige sua autorização e traz consequências jurídicas em um número crescente de jurisdições. A ficha do Kokoro é explícita: nenhum módulo de clonagem foi publicado junto com os pesos, o que exclui esse uso pela própria concepção do modelo, e não apenas por uma política de uso.
Para um projeto francês, essa combinação simplifica muitas coisas: não há contrato de licença de voz a negociar, não há pessoa real cujo consentimento seja necessário obter, e a licença Apache 2.0 não gera dúvidas sobre revenda ou integração em um produto pago. O único ponto de atenção restante é puramente técnico: verificar se a voz francesa escolhida soa bem nos textos reais do projeto, incluindo acentos e siglas, antes de colocá-la em uso em grande escala.
#FAQ
O Kokoro pode ser usado comercialmente?+
É necessária uma placa de vídeo?+
Ele pode clonar a minha voz?+
Kokoro ou Piper?+
Quais línguas são suportadas e o francês faz parte delas?+
De onde vêm os dados de treinamento de Kokoro?+
Qual o custo real em comparação com uma API de nuvem?+
Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.