시작하기무료로 시작하기

오디오 전처리

이 연습 문제에서는 오디오 데이터의 샘플링 레이트를 조정하는 방법과 자동 전처리기를 사용하는 방법을 배워요. 작업할 데이터는 VCTK Corpus로, 다양한 억양을 가진 110명의 영어 화자가 발화한 약 44시간 분량의 음성 데이터를 포함하고 있어요.

dataset은 이미 로드되어 있어요.

이 연습은 강의의 일부입니다

Hugging Face로 배우는 멀티모달 모델

강의 보기

연습 안내

  • .cast_column() 메서드를 사용해 데이터셋의 오디오를 16,000 Hz로 리샘플링하세요.
  • 사전 학습된 openai/whisper-small 모델을 사용해 오디오 프로세서를 로드하세요.
  • 첫 번째 데이터 포인트의 오디오 데이터를 전처리하되, 동일한 샘플링 레이트를 지정하고 padding=True로 설정하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
코드 편집 및 실행