Bắt đầu ngayBắt đầu miễn phí

Tạo giọng nói mới

Đến lúc hoàn thiện kỹ năng dùng các mô hình âm thanh của Hugging Face! Bạn sẽ dùng một mô hình đã fine-tune để tạo giọng nói mới dựa trên một giọng có sẵn. Bạn sẽ chọn một giọng từ VCTK Corpus làm nền cho âm thanh mới.

dataset và mô hình SpeechT5ForTextToSpeech (model) đã được nạp sẵn, và một hàm make_spectogram() đã được cung cấp để hỗ trợ việc vẽ biểu đồ.

Bài tập này là một phần của khóa học

Mô hình đa phương thức với Hugging Face

Xem khóa học

Hướng dẫn bài tập

  • Tải một embedding người nói mẫu từ chỉ mục 5 của dataset phần test.
  • Sinh giọng nói từ văn bản đã xử lý bằng cách chỉ định inputs, speaker_embeddingvocoder.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
Chỉnh sửa và Chạy Mã