音声の前処理
この演習では、音声データのサンプリングレートを変更する方法と、自動プリプロセッサーの使い方を学びます。扱うデータは VCTK Corpus で、さまざまな訛りを持つ110人の英語話者による、約44時間の音声データが含まれています。
dataset はすでに読み込まれています。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
演習の手順
.cast_column()メソッドを使って、データセット内の音声を 16,000 Hz にリサンプリングします。- 事前学習済みモデル
openai/whisper-smallを使って、音声プロセッサーを読み込みます。 - 最初のデータポイントの音声データを前処理し、同じサンプリングレートを指定しつつ、
padding=Trueとします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])