Zacznij terazZacznij za darmo

Odszumianie audio

W tym ćwiczeniu wykorzystasz dane ze zbioru WHAM, który łączy mowę z szumem tła, aby wygenerować nową mowę w innym głosie – z usuniętym szumem tła!

Spektrogram zaszumionej mowy

Tablica example_speech oraz wektor speaker_embedding nowego głosu są już wczytane. Dostępne są również: preprocesor (processor), vocoder (vocoder) oraz moduł SpeechT5ForSpeechToSpeech. Do wizualizacji udostępniono funkcję make_spectrogram().

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj wstępnie wytrenowany model SpeechT5ForSpeechToSpeech, korzystając z checkpointu microsoft/speecht5_vc.
  • Wstępnie przetwórz example_speech z częstotliwością próbkowania 16000.
  • Wygeneruj odszumioną mowę za pomocą metody .generate_speech().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
Edytuj i uruchom kod