









ChatTTS là một mô hình tạo giọng nói được thiết kế cho các tình huống hội thoại. Nó lý tưởng cho các ứng dụng như các tác vụ đối thoại cho các trợ lý mô hình ngôn ngữ lớn, cũng như giới thiệu âm thanh và video hội thoại. Mô hình hỗ trợ cả tiếng Trung và tiếng Anh, thể hiện chất lượng cao và tính tự nhiên trong tổng hợp giọng nói. Mức hiệu suất này đạt được thông qua việc huấn luyện trên khoảng 100.000 giờ dữ liệu tiếng Trung và tiếng Anh. Nhóm dự án dự định mở mã một mô hình cơ bản được huấn luyện với 40.000 giờ dữ liệu, điều này sẽ hỗ trợ cộng đồng học thuật và nhà phát triển trong việc nghiên cứu và phát triển thêm.
Để sử dụng ChatTTS, tải mã từ GitHub, cài đặt các phụ thuộc cần thiết (torch và ChatTTS), nhập các thư viện cần thiết, khởi tạo ChatTTS, chuẩn bị văn bản của bạn, tạo ra giọng nói bằng cách sử dụng phương thức infer, và phát âm thanh đã tạo bằng lớp Audio từ IPython.display.



Lắng nghe mạng xã hội