НачатьНачать бесплатно

Агрегирование столбцов

Функция mutate(), с которой вы познакомились в предыдущем упражнении, принимает столбцы на вход и возвращает столбец. Если же вам нужно вычислить сводные статистики — например, среднее значение, максимум или стандартное отклонение — удобнее принимать столбцы на вход, но возвращать единственное значение. Для этого служит функция summarize().

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

Обратите внимание: в dplyr принято (и это правило унаследовано в sparklyr) хранить данные в формате tibble. Поэтому результат здесь — tibble с одной строкой и отдельным столбцом для каждой вычисленной сводной статистики.

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

Подключение к Spark уже создано и доступно как spark_conn. Tibble, связанный с метаданными треков в Spark, предварительно определён как track_metadata_tbl.

  • Выберите поля title и duration.
  • Передайте результат в следующий шаг, чтобы создать новое поле duration_minutes, содержащее длительность трека в минутах.
  • Передайте результат в summarize() для вычисления средней длительности в минутах — сохраните её в поле mean_duration_minutes.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
Редактировать и запускать код