Pobieranie danych z powrotem ze Spark
W ćwiczeniu „Badanie struktury tibbles" w rozdziale 1 zobaczyłeś, że tibbles nie przechowują kopii danych. Dane pozostają w Spark, a tibble jedynie zapamiętuje informacje o tym, co chciałby z niego pobrać.
Czasem jednak warto przenieść dane ze Spark do R. Część danych jest już przenoszona do R przy ich wyświetlaniu. Musisz jednak zebrać cały zbiór danych, gdy chcesz go zwizualizować lub skorzystać z techniki modelowania niedostępnej w Spark. (R oferuje przecież największy wybór dostępnych modeli spośród wszystkich języków programowania.)
Aby pobrać dane – czyli przenieść je ze Spark do R – wywołaj collect().
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark z pakietem sparklyr w R
Instrukcje do ćwiczenia
Połączenie ze Spark zostało już utworzone i jest dostępne jako spark_conn. Tibble powiązany z metadanymi utworów przechowywanymi w Spark jest wstępnie zdefiniowany jako track_metadata_tbl.
- Przefiltruj wiersze
track_metadata_tbl, gdzieartist_familiarityjest większe niż 0.9, i przypisz wyniki doresults. - Wyświetl klasę obiektu
results, zwracając uwagę, że jest totbl_lazy(używane dla danych zdalnych). - Zbierz wyniki za pomocą funkcji
collect()i przypisz je docollected. - Wyświetl klasę obiektu
collected, zwracając uwagę, że jest totbl_df(używane dla danych lokalnych).
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___