









ChatTTS est un modèle de génération vocale conçu pour des scénarios conversationnels. Il est idéal pour des applications telles que des tâches de dialogue pour des assistants de grands modèles de langage, ainsi que pour des introductions audio et vidéo conversationnelles. Le modèle prend en charge le chinois et l’anglais, démontrant une haute qualité et un caractère naturel dans la synthèse vocale. Ce niveau de performance est atteint grâce à un entraînement sur environ 100 000 heures de données en chinois et en anglais. L'équipe de projet prévoit de rendre open-source un modèle de base entraîné avec 40 000 heures de données, ce qui aidera les communautés académiques et de développeurs dans leurs recherches et développements futurs.
Pour utiliser ChatTTS, téléchargez le code depuis GitHub, installez les dépendances nécessaires (torch et ChatTTS), importez les bibliothèques requises, initialisez ChatTTS, préparez votre texte, générez la parole en utilisant la méthode d’inférence et jouez le son généré à l’aide de la classe Audio de l'IPython.display.


Écoute des médias sociaux