Выбор столбцов
Самый удобный способ работать с фреймами данных, хранящимися в Spark, — использовать синтаксис dplyr. Подробно манипуляции с фреймами данных в стиле dplyr рассматриваются в курсах Data Manipulation with dplyr и Joining Data with dplyr, однако в следующей главе с половиной вы разберёте все ключевые моменты.
В dplyr есть пять основных операций над фреймами данных: выбор столбцов, фильтрация строк, изменение порядка строк, преобразование или добавление столбцов, а также вычисление сводной статистики.
Начнём с выбора столбцов. Для этого используется функция select(): передайте ей тиббл, а затем имена нужных столбцов без кавычек. Функции dplyr принято применять вместе с оператором %>% из пакета magrittr (%>%). Чтобы выбрать столбцы x, y и z, напишите следующее.
a_tibble %>%
select(x, y, z)
Обратите внимание: индексирование с квадратными скобками в sparklyr пока не поддерживается. Поэтому следующий код работать не будет.
a_tibble[, c("x", "y", "z")]
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
Подключение к Spark уже создано и доступно как spark_conn. Тиббл, привязанный к метаданным треков, хранящимся в Spark, предопределён как track_metadata_tbl.
- Выберите столбцы
artist_name,release,titleиyearс помощьюselect(). - Попробуйте сделать то же самое, используя индексирование с квадратными скобками. Внимание: этот код вернёт ошибку, поэтому он обёрнут в вызов
tryCatch().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)