Перенос данных из Spark в R
В упражнении «Изучение структуры тиббл» в главе 1 вы увидели, что тиббл не хранит копию данных. Вместо этого данные остаются в Spark, а тиббл лишь сохраняет описание того, что нужно из него получить.
Существует немало причин, по которым может потребоваться перенести данные из Spark в R. Вы уже видели, как часть данных перемещается из Spark в R при выводе на экран. Кроме того, перенос необходим, если вы хотите построить график или использовать метод моделирования, недоступный в Spark. (В конце концов, R предлагает самый широкий выбор моделей среди всех языков программирования.)
Чтобы перенести данные из Spark в R, вызовите функцию collect().
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
Подключение к Spark уже создано и доступно как spark_conn. Тиббл, связанный с метаданными треков в Spark, заранее определён как track_metadata_tbl.
- Отфильтруйте строки
track_metadata_tbl, гдеartist_familiarityбольше 0.9, и сохраните результат в переменнуюresults. - Выведите класс
resultsи обратите внимание, что этоtbl_lazy— тип, используемый для удалённых данных. - Соберите результаты с помощью
collect()и сохраните их в переменнуюcollected. - Выведите класс
collectedи обратите внимание, что этоtbl_df— тип, используемый для локальных данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___