









ChatTTS é um modelo de geração de voz projetado para cenários de conversação. É ideal para aplicações como tarefas de diálogo para assistentes de grandes modelos de linguagem, bem como introduções em áudio e vídeo conversacional. O modelo suporta tanto chinês quanto inglês, demonstrando alta qualidade e naturalidade na síntese de fala. Esse nível de desempenho é alcançado por meio do treinamento em aproximadamente 100.000 horas de dados em chinês e inglês. A equipe do projeto planeja tornar um modelo básico treinado com 40.000 horas de dados de código aberto, o que ajudará as comunidades acadêmica e de desenvolvedores na pesquisa e no desenvolvimento adicionais.
Para usar o ChatTTS, baixe o código do GitHub, instale as dependências necessárias (torch e ChatTTS), importe as bibliotecas requeridas, inicialize o ChatTTS, prepare seu texto, gere a fala usando o método infer e reproduza o áudio gerado usando a classe Audio do IPython.display.


Escuta de mídias sociais