始める無料で始める

音声の前処理

この演習では、音声データのサンプリングレートを変更する方法と、自動プリプロセッサーの使い方を学びます。扱うデータは VCTK Corpus で、さまざまな訛りを持つ110人の英語話者による、約44時間の音声データが含まれています。

dataset はすでに読み込まれています。

この演習はコースの一部です

Hugging Face で学ぶマルチモーダルモデル

コースを見る

演習の手順

  • .cast_column() メソッドを使って、データセット内の音声を 16,000 Hz にリサンプリングします。
  • 事前学習済みモデル openai/whisper-small を使って、音声プロセッサーを読み込みます。
  • 最初のデータポイントの音声データを前処理し、同じサンプリングレートを指定しつつ、padding=True とします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
コードを編集して実行