분류용 데이터 살펴보기
이 장의 마지막 연습 문제에서는, 이 강의에서 사용할 두 개의 데이터셋을 탐색해 보겠습니다.
첫 번째 데이터셋은 심장 박동음 모음입니다. 정상적인 심장은 규칙적인 소리 패턴을 내지만, 일부 질환은 심장이 비정상적으로 뛰게 만들 수 있습니다. 이 데이터셋에는 각 박동 유형에 대한 레이블이 있는 훈련 세트와, 레이블이 없는 테스트 세트가 포함되어 있습니다. 여러분은 테스트 세트를 사용해 모델을 검증할 거예요.
레이블이 있는 데이터이므로, 이 데이터셋은 분류 문제에 적합합니다. 실제로 이 데이터는 원래 공개 Kaggle 대회의 일부로 제공되었습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 시계열 데이터 Machine Learning
연습 안내
glob를 사용해data_dir디렉터리 안의.wav파일 목록을 가져오세요.- 목록의 첫 번째 오디오 파일을
librosa로 불러오세요. - 데이터에 대한
time배열을 생성하세요. - 이 파일의 파형을
time배열과 함께 플로팅하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
import librosa as lr
from glob import glob
# List all the wav files in the folder
audio_files = ____(data_dir + '/*.wav')
# Read in the first audio file, create the time array
audio, sfreq = lr.load(____)
time = np.arange(0, len(audio)) / ____
# Plot audio over time
fig, ax = plt.subplots()
ax.plot(____, ____)
ax.set(xlabel='Time (s)', ylabel='Sound Amplitude')
plt.show()