Réduction du bruit audio
Dans cet exercice, vous utiliserez des données du jeu de données WHAM, qui mélange de la parole avec du bruit de fond, pour générer une nouvelle parole dans une voix différente et sans le bruit de fond!

Le tableau example_speech et le vecteur speaker_embedding de la nouvelle voix ont déjà été chargés. Le prétraitement (processor) et le vocodeur (vocoder) sont aussi disponibles, de même que le module SpeechT5ForSpeechToSpeech. Une fonction make_spectrogram() a été fournie pour vous aider à tracer le graphe.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Chargez le modèle préentraîné
SpeechT5ForSpeechToSpeechavec le point de contrôlemicrosoft/speecht5_vc. - Prétraitez
example_speechavec une fréquence d'échantillonnage de16000. - Générez l'audio débruité en utilisant
.generate_speech().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)