Začněte nyníZačněte zdarma

Stažení dat ze Sparku zpět do R

V cvičení „Exploring the structure of tibbles" v 1. kapitole jsi viděl/a, že tibbles neuchovávají kopii dat. Data zůstávají ve Sparku a tibble si pamatuje jen to, co chce ze Sparku načíst.

Důvodů, proč přesunout data ze Sparku do R, je celá řada. Část dat se do R přesouvá už při vypsání výsledků. Data ale budeš potřebovat stáhnout také tehdy, když je chceš vizualizovat nebo použít modelovací techniku, která ve Sparku není dostupná. (R ostatně nabízí nejširší výběr modelů ze všech programovacích jazyků.)

Data ze Sparku do R přesunesh pomocí funkce collect().

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Spark připojení je pro tebe již připraveno jako spark_conn. Tibble napojený na metadata skladeb uložená ve Sparku je předdefinován jako track_metadata_tbl.

  • Filtruj řádky track_metadata_tbl, kde je artist_familiarity větší než 0.9, a výsledek ulož do results.
  • Vypiš třídu objektu results — všimni si, že jde o tbl_lazy (používá se pro vzdálená data).
  • Stáhni výsledky pomocí collect() a ulož je do collected.
  • Vypiš třídu objektu collected — všimni si, že tentokrát jde o tbl_df (používá se pro lokální data).

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Upravit a spustit kód