Groepen mutanten
Naast het berekenen van samenvattende statistieken per groep kun je kolommen aanpassen met groep-specifieke waarden. Een veelgebruikte techniek om waarden te normaliseren is bijvoorbeeld: trek het gemiddelde af en deel daarna door de standaarddeviatie. Je kunt groepsspecifieke normalisatie uitvoeren met de volgende code.
a_tibble %>%
group_by(grp1, grp2) %>%
mutate(normalized_x = (x - mean(x)) / sd(x))
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble die gekoppeld is aan de trackmetadata die in Spark is opgeslagen, is vooraf gedefinieerd als track_metadata_tbl.
- Groepeer de inhoud van
track_metadataopartist_name. - Voeg een nieuwe kolom toe met de naam
time_since_first_release.- Laat deze gelijk zijn aan de groepsgewijze
yearminus het eersteyear(dus demin()year) waarop de artiest een track uitbracht.
- Laat deze gelijk zijn aan de groepsgewijze
- Sorteer de rijen in aflopende volgorde van
time_since_first_release.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Group by artist
___ %>%
# Calc time since first release
___ %>%
# Arrange by descending time since first release
___