Aan de slagBegin gratis

Groepen mutanten

Naast het berekenen van samenvattende statistieken per groep kun je kolommen aanpassen met groep-specifieke waarden. Een veelgebruikte techniek om waarden te normaliseren is bijvoorbeeld: trek het gemiddelde af en deel daarna door de standaarddeviatie. Je kunt groepsspecifieke normalisatie uitvoeren met de volgende code.

a_tibble %>%
  group_by(grp1, grp2) %>%
  mutate(normalized_x = (x - mean(x)) / sd(x))

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble die gekoppeld is aan de trackmetadata die in Spark is opgeslagen, is vooraf gedefinieerd als track_metadata_tbl.

  • Groepeer de inhoud van track_metadata op artist_name.
  • Voeg een nieuwe kolom toe met de naam time_since_first_release.
    • Laat deze gelijk zijn aan de groepsgewijze year minus het eerste year (dus de min() year) waarop de artiest een track uitbracht.
  • Sorteer de rijen in aflopende volgorde van time_since_first_release.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Group by artist
  ___ %>%
  # Calc time since first release
  ___ %>%
  # Arrange by descending time since first release
  ___
Code bewerken en uitvoeren