НачатьНачать бесплатно

Выбор столбцов

Самый удобный способ работать с фреймами данных, хранящимися в Spark, — использовать синтаксис dplyr. Подробно манипуляции с фреймами данных в стиле dplyr рассматриваются в курсах Data Manipulation with dplyr и Joining Data with dplyr, однако в следующей главе с половиной вы разберёте все ключевые моменты.

В dplyr есть пять основных операций над фреймами данных: выбор столбцов, фильтрация строк, изменение порядка строк, преобразование или добавление столбцов, а также вычисление сводной статистики.

Начнём с выбора столбцов. Для этого используется функция select(): передайте ей тиббл, а затем имена нужных столбцов без кавычек. Функции dplyr принято применять вместе с оператором %>% из пакета magrittr (%>%). Чтобы выбрать столбцы x, y и z, напишите следующее.

a_tibble %>%
  select(x, y, z)

Обратите внимание: индексирование с квадратными скобками в sparklyr пока не поддерживается. Поэтому следующий код работать не будет.

a_tibble[, c("x", "y", "z")]

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

Подключение к Spark уже создано и доступно как spark_conn. Тиббл, привязанный к метаданным треков, хранящимся в Spark, предопределён как track_metadata_tbl.

  • Выберите столбцы artist_name, release, title и year с помощью select().
  • Попробуйте сделать то же самое, используя индексирование с квадратными скобками. Внимание: этот код вернёт ошибку, поэтому он обёрнут в вызов tryCatch().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Редактировать и запускать код