ÎncepețiÎncepe gratuit

Colectarea datelor înapoi din Spark

În exercițiul „Explorarea structurii tibble-urilor" din Capitolul 1, ai văzut că tibble-urile nu stochează o copie a datelor. În schimb, datele rămân în Spark, iar tibble-ul reține doar detaliile despre ce anume dorește să recupereze din Spark.

Există multe situații în care ai putea dori să muți datele din Spark în R. Ai văzut deja că o parte din date sunt transferate din Spark în R atunci când le afișezi. De asemenea, trebuie să colectezi setul de date dacă vrei să îl vizualizezi sau dacă dorești să folosești o tehnică de modelare care nu este disponibilă în Spark. (La urma urmei, R oferă cea mai largă selecție de modele disponibile dintre toate limbajele de programare.)

Pentru a colecta datele – adică pentru a le muta din Spark în R – apelează collect().

Acest exercițiu face parte din cursul

Introducere în Spark cu sparklyr în R

Vezi cursul

Instrucțiuni pentru exercițiu

O conexiune Spark a fost creată pentru tine ca spark_conn. Un tibble atașat la metadatele pistelor stocate în Spark a fost predefinit ca track_metadata_tbl.

  • Filtrează rândurile din track_metadata_tbl unde artist_familiarity este mai mare decât 0.9, atribuind rezultatele variabilei results.
  • Afișează clasa lui results, observând că este tbl_lazy (folosit pentru date la distanță).
  • Colectează rezultatele, atribuindu-le variabilei collected.
  • Afișează clasa lui collected, observând că este tbl_df (folosit pentru date locale).

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Editează și rulează codul