НачатьНачать бесплатно

Что это за звук?

Песня по своей природе — явление аналоговое: звук представляет собой колебания воздуха. Чтобы анализировать песню, её нужно преобразовать в числовые данные. В наборе данных Million Song Dataset для каждого трека записаны двенадцать измерений тембра, снятых через равные промежутки времени. (Тембр — это характеристика воспринимаемого качества звука; с его помощью можно, например, отличить голос от струнного инструмента или ударных.)

В этой главе вы будете предсказывать год выпуска трека на основе его тембральных характеристик. Иными словами, вы используете измерения тембра для формирования признаков модели. (Напомним, что признак — это термин машинного обучения, обозначающий входную переменную модели. В статистике их часто называют объясняющими переменными.)

Данные о тембре представлены в виде матрицы: строки соответствуют временны́м точкам, а столбцы — различным измерениям тембра. Таким образом, все матрицы тембра содержат двенадцать столбцов, однако количество строк варьируется от песни к песне. Среднее значение по каждому столбцу оценивает усреднённое значение тембрального показателя за всю песню. Эти средние значения и станут двенадцатью признаками для модели.

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

В рабочем пространстве заранее определена переменная timbre, содержащая тембральные измерения для песни Lady Gaga «Poker Face».

  • С помощью colMeans() вычислите средние значения по столбцам матрицы timbre. Запишите результат в переменную mean_timbre.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# timbre has been pre-defined
timbre

# Calculate column means
(mean_timbre <- ___)
Редактировать и запускать код