Агрегирование столбцов
Функция mutate(), с которой вы познакомились в предыдущем упражнении, принимает столбцы на вход и возвращает столбец. Если же вам нужно вычислить сводные статистики — например, среднее значение, максимум или стандартное отклонение — удобнее принимать столбцы на вход, но возвращать единственное значение. Для этого служит функция summarize().
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
Обратите внимание: в dplyr принято (и это правило унаследовано в sparklyr) хранить данные в формате tibble. Поэтому результат здесь — tibble с одной строкой и отдельным столбцом для каждой вычисленной сводной статистики.
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
Подключение к Spark уже создано и доступно как spark_conn. Tibble, связанный с метаданными треков в Spark, предварительно определён как track_metadata_tbl.
- Выберите поля
titleиduration. - Передайте результат в следующий шаг, чтобы создать новое поле
duration_minutes, содержащее длительность трека в минутах. - Передайте результат в
summarize()для вычисления средней длительности в минутах — сохраните её в полеmean_duration_minutes.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___