НачатьНачать бесплатно

Перенос данных из Spark в R

В упражнении «Изучение структуры тиббл» в главе 1 вы увидели, что тиббл не хранит копию данных. Вместо этого данные остаются в Spark, а тиббл лишь сохраняет описание того, что нужно из него получить.

Существует немало причин, по которым может потребоваться перенести данные из Spark в R. Вы уже видели, как часть данных перемещается из Spark в R при выводе на экран. Кроме того, перенос необходим, если вы хотите построить график или использовать метод моделирования, недоступный в Spark. (В конце концов, R предлагает самый широкий выбор моделей среди всех языков программирования.)

Чтобы перенести данные из Spark в R, вызовите функцию collect().

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

Подключение к Spark уже создано и доступно как spark_conn. Тиббл, связанный с метаданными треков в Spark, заранее определён как track_metadata_tbl.

  • Отфильтруйте строки track_metadata_tbl, где artist_familiarity больше 0.9, и сохраните результат в переменную results.
  • Выведите класс results и обратите внимание, что это tbl_lazy — тип, используемый для удалённых данных.
  • Соберите результаты с помощью collect() и сохраните их в переменную collected.
  • Выведите класс collected и обратите внимание, что это tbl_df — тип, используемый для локальных данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Редактировать и запускать код