НачатьНачать бесплатно

Группировка с мутацией

Помимо вычисления сводной статистики по группам, вы можете изменять столбцы, добавляя в них значения, характерные для каждой группы. Например, один из способов нормализации данных — вычесть среднее и разделить на стандартное отклонение. Выполнить нормализацию в рамках группы можно с помощью следующего кода.

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

Подключение к Spark уже создано и доступно как spark_conn. Tibble, привязанный к метаданным треков, хранящимся в Spark, предопределён как track_metadata_tbl.

  • Сгруппируйте содержимое track_metadata по artist_name.
  • Добавьте новый столбец time_since_first_release.
    • Задайте его как разность между year внутри группы и первым годом выпуска трека этим исполнителем (то есть min() от year).
  • Отсортируйте строки по убыванию time_since_first_release.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
Редактировать и запускать код