CommencezCommencez gratuitement

Réduction du bruit audio

Dans cet exercice, vous utiliserez des données du jeu de données WHAM, qui mélange de la parole avec du bruit de fond, pour générer une nouvelle parole dans une voix différente et sans le bruit de fond!

Spectrogram of noisy speech

Le tableau example_speech et le vecteur speaker_embedding de la nouvelle voix ont déjà été chargés. Le prétraitement (processor) et le vocodeur (vocoder) sont aussi disponibles, de même que le module SpeechT5ForSpeechToSpeech. Une fonction make_spectrogram() a été fournie pour vous aider à tracer le graphe.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Chargez le modèle préentraîné SpeechT5ForSpeechToSpeech avec le point de contrôle microsoft/speecht5_vc.
  • Prétraitez example_speech avec une fréquence d'échantillonnage de 16000.
  • Générez l'audio débruité en utilisant .generate_speech().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
Modifier et exécuter le code