ПочатиПочніть безкоштовно

Знешумлення аудіо

У цій вправі ви використаєте дані з набору WHAM, де мовлення змішано з фоновим шумом, щоб згенерувати нове мовлення іншим голосом і вже без фонового шуму!

Spectrogram of noisy speech

Масив example_speech і вектор speaker_embedding для нового голосу вже завантажені. Також доступні препроцесор (processor) і вокодер (vocoder), а ще модуль SpeechT5ForSpeechToSpeech. Функція make_spectrogram() надана, щоб допомогти з побудовою графіка.

Ця вправа є частиною курсу

Багатомодальні моделі з Hugging Face

Переглянути курс

Інструкції до вправи

  • Завантажте попередньо натреновану модель SpeechT5ForSpeechToSpeech, використовуючи контрольну точку microsoft/speecht5_vc.
  • Попередньо обробіть example_speech із частотою дискретизації 16000.
  • Згенеруйте знешумлене мовлення за допомогою .generate_speech().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
Редагувати та запускати код