Začněte nyníZačněte zdarma

Sumarizace sloupců

Funkce mutate(), kterou jsi viděl/a v předchozím cvičení, přijímá sloupce jako vstup a vrací sloupec. Pokud ale počítáš souhrnné statistiky, jako je průměr, maximum nebo směrodatná odchylka, chceš sice vzít sloupce jako vstup, ale vrátit jedinou hodnotu. K tomu slouží funkce summarize().

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

Všimni si, že dplyr (a spolu s ním i sparklyr) vždy uchovává data v tibble. Výsledkem je tedy tibble s jedním řádkem a jedním sloupcem pro každou vypočítanou souhrnnou statistiku.

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Spark připojení je pro tebe vytvořeno jako spark_conn. Tibble napojená na metadata skladeb uložená ve Sparku je předdefinována jako track_metadata_tbl.

  • Vyber pole title a duration.
  • Výsledek předej dále a vytvoř nové pole duration_minutes s délkou skladby v minutách.
  • Výsledek předej do summarize() a vypočítej průměrnou délku v minutách — výsledek ulož do pole mean_duration_minutes.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
Upravit a spustit kód