Colectarea datelor înapoi din Spark
În exercițiul „Explorarea structurii tibble-urilor" din Capitolul 1, ai văzut că tibble-urile nu stochează o copie a datelor. În schimb, datele rămân în Spark, iar tibble-ul reține doar detaliile despre ce anume dorește să recupereze din Spark.
Există multe situații în care ai putea dori să muți datele din Spark în R. Ai văzut deja că o parte din date sunt transferate din Spark în R atunci când le afișezi. De asemenea, trebuie să colectezi setul de date dacă vrei să îl vizualizezi sau dacă dorești să folosești o tehnică de modelare care nu este disponibilă în Spark. (La urma urmei, R oferă cea mai largă selecție de modele disponibile dintre toate limbajele de programare.)
Pentru a colecta datele – adică pentru a le muta din Spark în R – apelează collect().
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
O conexiune Spark a fost creată pentru tine ca spark_conn. Un tibble atașat la metadatele pistelor stocate în Spark a fost predefinit ca track_metadata_tbl.
- Filtrează rândurile din
track_metadata_tblundeartist_familiarityeste mai mare decât 0.9, atribuind rezultatele variabileiresults. - Afișează clasa lui
results, observând că estetbl_lazy(folosit pentru date la distanță). - Colectează rezultatele, atribuindu-le variabilei
collected. - Afișează clasa lui
collected, observând că estetbl_df(folosit pentru date locale).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___