Aan de slagBegin gratis

Rijen sorteren

Vroeger, toen muziek nog op cd’s stond, was er een terugkerend probleem: hoe orden je je cd’s zodat je snel vindt wat je zoekt? Op artiest? Chronologisch? Op genre?

De functie arrange() laat je de rijen van een tibble herschikken. Je geeft een tibble door, gevolgd door de ongenoteerde kolomnamen. Bijvoorbeeld, om eerst oplopend te sorteren op de waarden van kolom x en vervolgens (bij gelijke x) aflopend op de waarden van y, schrijf je het volgende.

a_tibble %>%
  arrange(x, desc(y))

Let op het gebruik van desc() om aflopend te sorteren. Wees er ook van bewust dat in sparklyr de functie order(), die wordt gebruikt om rijen van data.frames te sorteren, niet werkt.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Er is al een Spark-verbinding voor je gemaakt als spark_conn. Een tibble die is gekoppeld aan de trackmetadata die in Spark is opgeslagen, is vooraf gedefinieerd als track_metadata_tbl.

  • Selecteer de velden artist_name, release, title en year.
  • Pipe het resultaat om te filteren op tracks uit de jaren 60.
  • Pipe het resultaat naar arrange() om te sorteren op artist_name, daarna aflopend year, en vervolgens title.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Filter rows
  ___ %>%
  # Arrange rows
  ___
Code bewerken en uitvoeren