









ChatTTS是一個設計用於對話場景的語音生成模型。它非常適合應用於大型語言模型助手的對話任務,以及對話音頻和視頻介紹。該模型支援中文和英文,語音合成的質量和自然度都很高。這樣的表現是通過訓練約100,000小時的中文和英文數據實現的。項目團隊計畫開源一個基於40,000小時數據訓練的基本模型,這將有助於學術界和開發者社群進一步的研究和開發。
使用ChatTTS的方法是,從GitHub下載代碼,安裝必要依賴(torch和ChatTTS),導入所需的庫,初始化ChatTTS,準備你的文本,使用infer方法生成語音,並透過IPython.display的Audio類別播放生成的音頻。



社群媒體聆聽