Začněte nyníZačněte zdarma

Odšumění audia

V tomto cvičení použiješ data z datasetu WHAM, který kombinuje řeč se šumem pozadí – a z toho vygeneruješ novou řeč v jiném hlase a bez šumu na pozadí!

Spektrogram zašuměné řeči

Pole example_speech a vektor speaker_embedding nového hlasu jsou již načteny. K dispozici máš také předzpracovatel (processor) a vocoder (vocoder) spolu s modulem SpeechT5ForSpeechToSpeech. Pro vykreslení grafu je připravena funkce make_spectrogram().

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Načti přetrénovaný model SpeechT5ForSpeechToSpeech pomocí checkpointu microsoft/speecht5_vc.
  • Předzpracuj example_speech se vzorkovací frekvencí 16000.
  • Vygeneruj odšuměnou řeč pomocí .generate_speech().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
Upravit a spustit kód