Odszumianie audio
W tym ćwiczeniu wykorzystasz dane ze zbioru WHAM, który łączy mowę z szumem tła, aby wygenerować nową mowę w innym głosie – z usuniętym szumem tła!

Tablica example_speech oraz wektor speaker_embedding nowego głosu są już wczytane. Dostępne są również: preprocesor (processor), vocoder (vocoder) oraz moduł SpeechT5ForSpeechToSpeech. Do wizualizacji udostępniono funkcję make_spectrogram().
To ćwiczenie jest częścią kursu
Modele multimodalne z Hugging Face
Instrukcje do ćwiczenia
- Wczytaj wstępnie wytrenowany model
SpeechT5ForSpeechToSpeech, korzystając z checkpointumicrosoft/speecht5_vc. - Wstępnie przetwórz
example_speechz częstotliwością próbkowania16000. - Wygeneruj odszumioną mowę za pomocą metody
.generate_speech().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)