始める無料で始める

音声のノイズ除去

この演習では、音声に環境ノイズを混ぜた WHAM データセットを使って、別の話者の声で、かつ背景ノイズを取り除いた新しい音声を生成します。

Spectrogram of noisy speech

新しい声の example_speech 配列と speaker_embedding ベクトルはすでに読み込まれています。前処理器(processor)とボコーダ(vocoder)、さらに SpeechT5ForSpeechToSpeech モジュールも利用可能です。プロット用に make_spectrogram() 関数も用意されています。

この演習はコースの一部です

Hugging Face で学ぶマルチモーダルモデル

コースを見る

演習の手順

  • microsoft/speecht5_vc チェックポイントを使って、SpeechT5ForSpeechToSpeech の事前学習済みモデルを読み込みます。
  • サンプリングレート 16000example_speech を前処理します。
  • .generate_speech() を使ってノイズ除去後の音声を生成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
コードを編集して実行