









ChatTTS es un modelo de generación de voz diseñado para escenarios conversacionales. Es ideal para aplicaciones como tareas de diálogo para asistentes de modelos de lenguaje grandes, así como introducciones de audio y video conversacionales. El modelo admite tanto chino como inglés, demostrando alta calidad y naturalidad en la síntesis de voz. Este nivel de rendimiento se logra a través del entrenamiento en aproximadamente 100,000 horas de datos en chino e inglés. El equipo del proyecto planea liberar un modelo básico de código abierto entrenado con 40,000 horas de datos, lo que ayudará a las comunidades académica y de desarrolladores en la investigación y el desarrollo adicionales.
Para usar ChatTTS, descargue el código desde GitHub, instale las dependencias necesarias (torch y ChatTTS), importe las bibliotecas requeridas, inicialice ChatTTS, prepare su texto, genere voz utilizando el método infer y reproduzca el audio generado usando la clase Audio de IPython.display.


Escucha en redes sociales