Eliminarea zgomotului din audio
În acest exercițiu, vei folosi date din setul de date WHAM, care combină vorbire cu zgomot de fundal, pentru a genera vorbire nouă într-o altă voce și fără zgomotul de fundal!

Arrayul example_speech și vectorul speaker_embedding al noii voci au fost deja încărcate. Preprocesorul (processor) și voderul (vocoder) sunt de asemenea disponibile, împreună cu modulul SpeechT5ForSpeechToSpeech. A fost furnizată și o funcție make_spectrogram() pentru a facilita vizualizarea.
Acest exercițiu face parte din cursul
Modele Multi-Modale cu Hugging Face
Instrucțiuni pentru exercițiu
- Încarcă modelul preantrenat
SpeechT5ForSpeechToSpeechfolosind checkpoint-ulmicrosoft/speecht5_vc. - Preprocesează
example_speechcu o rată de eșantionare de16000. - Generează vorbirea fără zgomot folosind
.generate_speech().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)