시작하기무료로 시작하기

분류용 데이터 살펴보기

이 장의 마지막 연습 문제에서는, 이 강의에서 사용할 두 개의 데이터셋을 탐색해 보겠습니다.

첫 번째 데이터셋은 심장 박동음 모음입니다. 정상적인 심장은 규칙적인 소리 패턴을 내지만, 일부 질환은 심장이 비정상적으로 뛰게 만들 수 있습니다. 이 데이터셋에는 각 박동 유형에 대한 레이블이 있는 훈련 세트와, 레이블이 없는 테스트 세트가 포함되어 있습니다. 여러분은 테스트 세트를 사용해 모델을 검증할 거예요.

레이블이 있는 데이터이므로, 이 데이터셋은 분류 문제에 적합합니다. 실제로 이 데이터는 원래 공개 Kaggle 대회의 일부로 제공되었습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 시계열 데이터 Machine Learning

강의 보기

연습 안내

  • glob를 사용해 data_dir 디렉터리 안의 .wav 파일 목록을 가져오세요.
  • 목록의 첫 번째 오디오 파일을 librosa로 불러오세요.
  • 데이터에 대한 time 배열을 생성하세요.
  • 이 파일의 파형을 time 배열과 함께 플로팅하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

import librosa as lr
from glob import glob

# List all the wav files in the folder
audio_files = ____(data_dir + '/*.wav')

# Read in the first audio file, create the time array
audio, sfreq = lr.load(____)
time = np.arange(0, len(audio)) / ____

# Plot audio over time
fig, ax = plt.subplots()
ax.plot(____, ____)
ax.set(xlabel='Time (s)', ylabel='Sound Amplitude')
plt.show()
코드 편집 및 실행