









ChatTTS는 대화 시나리오에 맞게 설계된 음성 생성 모델입니다. 이는 대규모 언어 모델 어시스턴트의 대화 작업 및 대화형 오디오 및 비디오 소개와 같은 애플리케이션에 이상적입니다. 이 모델은 중국어와 영어를 모두 지원하며, 음성 합성에서 높은 품질과 자연스러움을 보여줍니다. 이러한 성능은 약 100,000시간 분량의 중국어와 영어 데이터로 훈련하여 달성되었습니다. 프로젝트 팀은 40,000시간의 데이터로 훈련된 기본 모델을 오픈 소스화할 계획입니다. 이는 학문 및 개발 커뮤니티의 추가 연구 및 개발에 도움이 될 것입니다.
ChatTTS를 사용하려면 GitHub에서 코드를 다운로드하고 필요한 종속성(torch 및 ChatTTS)을 설치한 다음, 필요한 라이브러리를 가져오고 ChatTTS를 초기화합니다. 텍스트를 준비하고 infer 메서드를 사용하여 음성을 생성한 다음, IPython.display의 Audio 클래스를 사용하여 생성된 오디오를 재생합니다.


소셜 리스닝