Изучение данных для классификации
В этих заключительных упражнениях главы вы познакомитесь с двумя наборами данных, которые будете использовать на протяжении всего курса.
Первый — это коллекция записей звуков сердцебиения. В норме сердце бьётся с предсказуемым ритмом, однако некоторые заболевания могут вызывать нарушения сердечного ритма. Этот набор данных содержит обучающую выборку с метками для каждого типа сердцебиения и тестовую выборку без меток. Тестовую выборку вы будете использовать для проверки своих моделей.
Поскольку данные размечены, этот набор идеально подходит для задачи классификации. Кстати, он изначально был предложен в рамках открытого соревнования на Kaggle.
Это упражнение является частью курса
Машинное обучение для данных временных рядов на Python
Инструкции к упражнению
- С помощью
globполучите список файлов.wavиз директорииdata_dir. - Загрузите первый аудиофайл из списка с помощью
librosa. - Сформируйте массив времени
timeдля полученных данных. - Постройте график формы волны для этого файла, используя массив времени.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
import librosa as lr
from glob import glob
# List all the wav files in the folder
audio_files = ____(data_dir + '/*.wav')
# Read in the first audio file, create the time array
audio, sfreq = lr.load(____)
time = np.arange(0, len(audio)) / ____
# Plot audio over time
fig, ax = plt.subplots()
ax.plot(____, ____)
ax.set(xlabel='Time (s)', ylabel='Sound Amplitude')
plt.show()