Группировка с мутацией
Помимо вычисления сводной статистики по группам, вы можете изменять столбцы, добавляя в них значения, характерные для каждой группы. Например, один из способов нормализации данных — вычесть среднее и разделить на стандартное отклонение. Выполнить нормализацию в рамках группы можно с помощью следующего кода.
a_tibble %>%
group_by(grp1, grp2) %>%
mutate(normalized_x = (x - mean(x)) / sd(x))
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
Подключение к Spark уже создано и доступно как spark_conn. Tibble, привязанный к метаданным треков, хранящимся в Spark, предопределён как track_metadata_tbl.
- Сгруппируйте содержимое
track_metadataпоartist_name. - Добавьте новый столбец
time_since_first_release.- Задайте его как разность между
yearвнутри группы и первым годом выпуска трека этим исполнителем (то естьmin()отyear).
- Задайте его как разность между
- Отсортируйте строки по убыванию
time_since_first_release.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Group by artist
___ %>%
# Calc time since first release
___ %>%
# Arrange by descending time since first release
___