Sumarizace sloupců
Funkce mutate(), kterou jsi viděl/a v předchozím cvičení, přijímá sloupce jako vstup a vrací sloupec. Pokud ale počítáš souhrnné statistiky, jako je průměr, maximum nebo směrodatná odchylka, chceš sice vzít sloupce jako vstup, ale vrátit jedinou hodnotu. K tomu slouží funkce summarize().
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
Všimni si, že dplyr (a spolu s ním i sparklyr) vždy uchovává data v tibble. Výsledkem je tedy tibble s jedním řádkem a jedním sloupcem pro každou vypočítanou souhrnnou statistiku.
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Spark připojení je pro tebe vytvořeno jako spark_conn. Tibble napojená na metadata skladeb uložená ve Sparku je předdefinována jako track_metadata_tbl.
- Vyber pole
titleaduration. - Výsledek předej dále a vytvoř nové pole
duration_minutess délkou skladby v minutách. - Výsledek předej do
summarize()a vypočítej průměrnou délku v minutách — výsledek ulož do polemean_duration_minutes.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___