Stažení dat ze Sparku zpět do R
V cvičení „Exploring the structure of tibbles" v 1. kapitole jsi viděl/a, že tibbles neuchovávají kopii dat. Data zůstávají ve Sparku a tibble si pamatuje jen to, co chce ze Sparku načíst.
Důvodů, proč přesunout data ze Sparku do R, je celá řada. Část dat se do R přesouvá už při vypsání výsledků. Data ale budeš potřebovat stáhnout také tehdy, když je chceš vizualizovat nebo použít modelovací techniku, která ve Sparku není dostupná. (R ostatně nabízí nejširší výběr modelů ze všech programovacích jazyků.)
Data ze Sparku do R přesunesh pomocí funkce collect().
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Spark připojení je pro tebe již připraveno jako spark_conn. Tibble napojený na metadata skladeb uložená ve Sparku je předdefinován jako track_metadata_tbl.
- Filtruj řádky
track_metadata_tbl, kde jeartist_familiarityvětší než 0.9, a výsledek ulož doresults. - Vypiš třídu objektu
results— všimni si, že jde otbl_lazy(používá se pro vzdálená data). - Stáhni výsledky pomocí
collect()a ulož je docollected. - Vypiš třídu objektu
collected— všimni si, že tentokrát jde otbl_df(používá se pro lokální data).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___