ÎncepețiÎncepe gratuit

Eliminarea zgomotului din audio

În acest exercițiu, vei folosi date din setul de date WHAM, care combină vorbire cu zgomot de fundal, pentru a genera vorbire nouă într-o altă voce și fără zgomotul de fundal!

Spectrogram of noisy speech

Arrayul example_speech și vectorul speaker_embedding al noii voci au fost deja încărcate. Preprocesorul (processor) și voderul (vocoder) sunt de asemenea disponibile, împreună cu modulul SpeechT5ForSpeechToSpeech. A fost furnizată și o funcție make_spectrogram() pentru a facilita vizualizarea.

Acest exercițiu face parte din cursul

Modele Multi-Modale cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă modelul preantrenat SpeechT5ForSpeechToSpeech folosind checkpoint-ul microsoft/speecht5_vc.
  • Preprocesează example_speech cu o rată de eșantionare de 16000.
  • Generează vorbirea fără zgomot folosind .generate_speech().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
Editează și rulează codul