Знешумлення аудіо
У цій вправі ви використаєте дані з набору WHAM, де мовлення змішано з фоновим шумом, щоб згенерувати нове мовлення іншим голосом і вже без фонового шуму!

Масив example_speech і вектор speaker_embedding для нового голосу вже завантажені. Також доступні препроцесор (processor) і вокодер (vocoder), а ще модуль SpeechT5ForSpeechToSpeech. Функція make_spectrogram() надана, щоб допомогти з побудовою графіка.
Ця вправа є частиною курсу
Багатомодальні моделі з Hugging Face
Інструкції до вправи
- Завантажте попередньо натреновану модель
SpeechT5ForSpeechToSpeech, використовуючи контрольну точкуmicrosoft/speecht5_vc. - Попередньо обробіть
example_speechіз частотою дискретизації16000. - Згенеруйте знешумлене мовлення за допомогою
.generate_speech().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)