Iniciante 10 minÁudio

Kokoro TTS: uma voz local convincente e leve

Resposta direta

Kokoro (hexgrad/Kokoro-82M, licença Apache 2.0) é um modelo aberto de síntese de voz com 82 milhões de parâmetros, baseado em StyleTTS 2 e ISTFTNet. Ele abrange 8 idiomas e 54 vozes (incluindo o francês), roda mais rápido que o tempo real no processador e foi treinado exclusivamente com áudio livre de direitos — sem possibilidade de clonagem, pois nenhum módulo de clonagem foi publicado. Custo observado via API: menos de US$ 1 por milhão de caracteres.

A maioria dos bons sistemas de síntese de voz roda na nuvem ou exige hardware potente. Kokoro é um modelo aberto (repositório hexgrad/Kokoro-82M, licença Apache 2.0) de tamanho muito pequeno, com um resultado convincente, que gera áudio mais rápido que o tempo real em uma máquina comum — inclusive sem placa de vídeo. Sua ficha técnica é excepcionalmente precisa sobre o que contém, inclusive sobre a origem dos dados de treinamento, o que faz do Kokoro um caso raro de modelo de voz cujas afirmações podem ser verificadas uma a uma, em vez de simplesmente serem aceitas sem comprovação.

Por Mohamed Meguedmi·Atualização 2026-09-28·Testado no Windows, macOS e Linux

#Por que um modelo pequeno muda o cálculo

A qualidade da síntese vocal já não é mais um problema há algum tempo; o custo e a localização, sim. As vozes online soam muito bem e implicam que cada frase pronunciada pelo seu sistema seja enviada para um prestador e cobrada por uso. Os grandes modelos locais soam bem e ocupam uma placa gráfica que você preferiria dar ao seu modelo de linguagem em vez da voz que o faz falar.

Um modelo pequeno o suficiente para rodar em um segundo em um processador elimina as duas restrições de uma vez. Ler um documento longo em voz alta deixa de ser uma decisão orçamentária. Um assistente pode pronunciar todas as suas respostas, em vez de apenas as respostas importantes. Um processamento em lote pode narrar cem arquivos durante a noite no equipamento que você já possui, sem enviar nada a terceiros, sem esperar por uma cota nem monitorar uma fatura que aumenta com o volume processado.

#O modelo, em números verificados

O kit IA Local

Seu ChatGPT privado e gratuito na sua máquina em 1 hora — LM Studio, Ollama, Open WebUI, seus documentos, sem nuvem.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias
82 milhões de parâmetros
Uma ordem de grandeza abaixo dos modelos com os quais ele costuma ser comparado.
Arquitetura StyleTTS 2 + ISTFTNet
Uma arquitetura “somente decodificador”, sem difusão, o que explica em parte sua leveza.
8 idiomas, 54 vozes (v1.0)
Publicada em 27 de janeiro de 2025, treinada com algumas centenas de horas de áudio.
Custo total de treinamento: cerca de $ 1.000
1.000 horas de cálculo em GPU A100 de 80 GB ao todo, um orçamento minúsculo para esse resultado em comparação com os modelos concorrentes.
Dados exclusivamente livres de direitos
Áudio de domínio público, sob licenças permissivas, ou áudio sintético de fornecedores comerciais fechados — explicitamente, nunca clones de voz não autorizados nem áudio de outro modelo aberto.

Esse último ponto merece destaque: a ficha do modelo é explícita sobre a origem dos dados, o que é raro nesse campo. É uma das razões pelas quais o Kokoro pode ser implantado sem a indefinição jurídica que envolve modelos treinados com vozes obtidas ou clonadas sem autorização — um ponto especialmente relevante para um projeto voltado ao público em geral na França, onde o direito à imagem associado à voz é levado a sério. Quando foi lançado, o Kokoro conquistou o primeiro lugar no ranking comunitário TTS Spaces Arena, à frente de modelos significativamente maiores: XTTS v2 (467 milhões de parâmetros), MetaVoice (1,2 bilhão) e Fish Speech (cerca de 500 milhões) foram todos superados por um modelo de 82 milhões — um ranking de uma época específica, não uma garantia universal, mas um forte sinal da relação qualidade/tamanho para quem precisa escolher rapidamente sem executar dez modelos em paralelo.

#O que faz e o que não faz

Capacidades reais
CapacidadeKokoro
Prosódia natural em textos comuns em prosaSólido para o seu tamanho
Vozes predefinidas54 vozes distribuídas em 8 idiomas, incluindo o francês (fr-fr)
Clonagem de voz a partir de uma amostraIsso não é seu objetivo: nenhum módulo de clonagem foi publicado com os pesos
Controle preciso da expressão emocionalLimitado
VelocidadeMais rápido que o tempo real em hardware modesto
Funcionamento offlineSim, após os pesos serem baixados via pip install kokoro

Uma descrição honesta: é um ótimo leitor, não um ator. Para narração, notificações, um assistente ou acessibilidade, é mais do que suficiente. Para um trabalho de interpretação em que uma intenção específica importa, você precisará de uma ferramenta que permita um direcionamento mais preciso. Quanto ao orçamento, o preço observado via API gira em torno de US$ 1 por milhão de caracteres de entrada — cerca de mil caracteres para um minuto de áudio gerado —, uma referência útil mesmo no uso local, para comparar com o custo real de uma assinatura equivalente na nuvem ao longo do tempo.

#Sua posição em uma cadeia local

  1. 01
    A voz entra
    Um modelo de transcrição converte a fala do usuário em texto; o Faster-Whisper cobre bem esse passo, mesmo sem GPU.
  2. 02
    O modelo pensa
    Um modelo local gera a resposta, com o Ollama ou outro motor fornecendo acesso ao modelo.
  3. 03
    A voz sai
    O Kokoro lê a resposta por meio do pacote Python kokoro, que se baseia na biblioteca de fonetização misaki e no espeak-ng como alternativa para algumas palavras fora do dicionário.

O orçamento de latência deve sempre ser considerado como um todo: o usuário percebe o tempo total — primeiro a transcrição, depois a geração e, por fim, a síntese. A síntese geralmente é a etapa menos custosa das três, o que significa que a rapidez de resposta percebida de um assistente de voz é determinada principalmente pela velocidade do seu modelo de linguagem, e não pela voz que lê a resposta final.

→
Transmita a voz à medida que o texto chega
Esperar a resposta completa antes de começar a falar desperdiça os segundos que o modelo gastou para produzi-la. Sintetizar frase por frase enquanto o texto chega torna o sistema incrivelmente mais ágil sem ser mais rápido.

#Três usos concretos em francês

A voz fr-fr do Kokoro torna o modelo diretamente utilizável para um público de língua francesa, sem recorrer a uma voz inglesa com sotaque inadequado nem a um serviço de terceiros cobrado por uso. Três casos aparecem com mais frequência nos projetos que o adotam.

Leitura de documentos longos
Relatórios, artigos, notas de acompanhamento: narrar um documento de várias páginas custa apenas um pouco de tempo de processamento, em vez de uma assinatura de uma API cobrada por caractere.
Assistente de voz doméstico ou profissional
Combinado com Whisper para reconhecimento de voz e com um LLM local para reflexão, Kokoro fecha o ciclo sem que nenhuma conversa saia da rede local.
Acessibilidade e notificações
Leitura de tela, alertas vocais, confirmação de ações: usos em que a latência e a disponibilidade offline são mais importantes do que a nuance de interpretação.

Nos três casos, a lógica orçamentária muda de natureza: em vez de um custo por caractere cobrado a cada chamada, o gasto passa a ser a eletricidade e o tempo de processamento de uma máquina que você já possui. Para um volume elevado de texto lido em voz alta — do monitoramento documental diário a um serviço de atendimento ao cliente por voz — a diferença cresce rapidamente a favor da execução local, especialmente porque a geração continua mais rápida que o tempo real, mesmo sem placa de vídeo dedicada.

#Kokoro ou Piper

Duas prioridades diferentes
KokoroPiper
Qualidade da saídaSuperior, prosódia mais naturalBoa, mais monótona
Tamanho82 milhões de parâmetros, um único modeloMuito pequeno, um modelo ONNX por voz (VITS)
Velocidade no processadorRápidoExtremamente rápido, projetado para hardware com recursos muito limitados
Cobertura linguística8 idiomas, 54 vozes (v1.0)44 idiomas/localidades na lista oficial de vozes
LicençaApache 2.0, licença única para todas as vozesGPL-3.0 no repositório ativo; MIT no antigo repositório, agora arquivado
Escolha quandoA qualidade é prioridadeO consumo de recursos, a latência ou uma voz de uma localidade linguística específica têm prioridade

A questão da licença do Piper merece ser verificada antes de se comprometer: o repositório histórico rhasspy/piper, sob licença MIT, está agora arquivado e em modo somente leitura. O desenvolvimento ativo foi transferido para OHF-Voice/piper1-gpl, mantido pela Open Home Foundation sob licença GPL-3.0 — uma diferença real para uso comercial em comparação com os tutoriais que ainda citam a licença MIT do repositório antigo. A documentação oficial do Piper acrescenta que algumas vozes individuais podem ter licenças mais restritivas do que a do motor: verificar voz por voz, não apenas no nível do projeto. O Piper continua sendo estruturado de forma diferente do Kokoro: cada voz é um modelo VITS distinto exportado em ONNX, com um arquivo .onnx e um arquivo .onnx.json de configuração, enquanto o Kokoro oferece suas 54 vozes a partir de um único conjunto de pesos compartilhados.

#Licença e ética

Duas questões determinam se um modelo de síntese de voz pode ser usado no seu projeto, e apenas uma é técnica. A primeira é a licença dos pesos e das vozes, que rege o uso comercial: no caso do Kokoro, é a Apache 2.0, uma licença permissiva e sem ambiguidades que cobre todas as 54 vozes — não é o caso de todos os motores, sendo o Piper o exemplo mais próximo, com sua recente mudança para a GPL-3.0. A segunda é que um modelo com vozes predefinidas evita completamente a questão do consentimento, enquanto clonar a voz de alguém a partir de uma amostra exige sua autorização e traz consequências jurídicas em um número crescente de jurisdições. A ficha do Kokoro é explícita: nenhum módulo de clonagem foi publicado junto com os pesos, o que exclui esse uso pela própria concepção do modelo, e não apenas por uma política de uso.

Para um projeto francês, essa combinação simplifica muitas coisas: não há contrato de licença de voz a negociar, não há pessoa real cujo consentimento seja necessário obter, e a licença Apache 2.0 não gera dúvidas sobre revenda ou integração em um produto pago. O único ponto de atenção restante é puramente técnico: verificar se a voz francesa escolhida soa bem nos textos reais do projeto, incluindo acentos e siglas, antes de colocá-la em uso em grande escala.

#FAQ

O Kokoro pode ser usado comercialmente?+
Sim. Kokoro-82M está publicado sob licença Apache 2.0, uma das licenças abertas mais permissivas, e sua página afirma que ele «pode ser implantado em qualquer lugar, de um ambiente de produção a um projeto pessoal». Nenhum royalty nem atribuição além dos termos padrão da Apache é exigido, e isso abrange todas as 54 vozes em conjunto.
É necessária uma placa de vídeo?+
Não. Seus 82 milhões de parâmetros tornam a geração no processador viável, geralmente mais rápida do que o tempo real em hardware comum. Uma GPU ajuda no processamento de grandes volumes em lote, mas não é necessária para uso interativo em um assistente de voz.
Ele pode clonar a minha voz?+
Não, e essa é uma decisão deliberada de projeto: a ficha do modelo confirma que nenhum módulo de clonagem foi publicado com os pesos. Em vez disso, ele oferece 54 vozes predefinidas em 8 idiomas. A clonagem pertence a outra classe de modelos e levanta questões de consentimento que as vozes predefinidas evitam completamente.
Kokoro ou Piper?+
Kokoro para um resultado mais natural com 82 milhões de parâmetros; Piper quando o consumo mínimo de recursos e a menor latência são prioritários, tipicamente em hardware embarcado. Os dois funcionam totalmente offline, mas verifique a licença: o Kokoro está sob Apache 2.0, enquanto a versão do Piper mantida ativamente passou para GPL-3.0.
Quais línguas são suportadas e o francês faz parte delas?+
Sim: a versão 1.0 abrange 8 idiomas e 54 vozes, incluindo inglês americano e britânico, espanhol, francês, hindi, italiano, japonês, português brasileiro e mandarim. Verifique a disponibilidade exata das vozes por idioma no arquivo VOICES.md do modelo antes de escolher uma voz específica.
De onde vêm os dados de treinamento de Kokoro?+
De algumas centenas de horas de áudio, exclusivamente do domínio público, sob licença permissiva, ou de áudio sintético gerado por fornecedores comerciais fechados — explicitamente nunca de áudio proveniente de outro modelo aberto ou de um clone de voz não autorizado, de acordo com a declaração de origem publicada na ficha do modelo.
Qual o custo real em comparação com uma API de nuvem?+
Localmente, a única despesa recorrente é a eletricidade, para um modelo com 82 milhões de parâmetros que roda em alguns segundos no processador. Como referência, o preço observado no mercado para o Kokoro fornecido por API está em torno de US$ 1 por milhão de caracteres; esse valor serve como comparação útil antes de escolher entre auto-hospedagem e um serviço de terceiros.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.