Začněte nyníZačněte zdarma

Skupinové mutace

Kromě výpočtu souhrnných statistik podle skupin můžeš pomocí mutate() přidávat sloupce s hodnotami specifickými pro danou skupinu. Jednou z běžných technik normalizace hodnot je například odečtení průměru a vydělení směrodatnou odchylkou. Skupinovou normalizaci lze provést takto:

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojený na metadata skladeb uložená ve Sparku je předdefinován jako track_metadata_tbl.

  • Seskup obsah track_metadata podle artist_name.
  • Přidej nový sloupec s názvem time_since_first_release.
    • Nastav ho jako rozdíl skupinového year a prvního roku vydání (tedy min() year) pro daného interpreta.
  • Seřaď řádky sestupně podle time_since_first_release.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
Upravit a spustit kód