音声のノイズ除去
この演習では、音声に環境ノイズを混ぜた WHAM データセットを使って、別の話者の声で、かつ背景ノイズを取り除いた新しい音声を生成します。

新しい声の example_speech 配列と speaker_embedding ベクトルはすでに読み込まれています。前処理器(processor)とボコーダ(vocoder)、さらに SpeechT5ForSpeechToSpeech モジュールも利用可能です。プロット用に make_spectrogram() 関数も用意されています。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
演習の手順
microsoft/speecht5_vcチェックポイントを使って、SpeechT5ForSpeechToSpeechの事前学習済みモデルを読み込みます。- サンプリングレート
16000でexample_speechを前処理します。 .generate_speech()を使ってノイズ除去後の音声を生成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)