Tạo giọng nói mới
Đến lúc hoàn thiện kỹ năng dùng các mô hình âm thanh của Hugging Face! Bạn sẽ dùng một mô hình đã fine-tune để tạo giọng nói mới dựa trên một giọng có sẵn. Bạn sẽ chọn một giọng từ VCTK Corpus làm nền cho âm thanh mới.
dataset và mô hình SpeechT5ForTextToSpeech (model) đã được nạp sẵn, và một hàm make_spectogram() đã được cung cấp để hỗ trợ việc vẽ biểu đồ.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tải một embedding người nói mẫu từ chỉ mục
5củadatasetphần test. - Sinh giọng nói từ văn bản đã xử lý bằng cách chỉ định
inputs,speaker_embeddingvàvocoder.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)