Unieke rijen selecteren
Als je een categorische variabele als factor hebt opgeslagen, is het vaak handig om te weten wat de afzonderlijke categorieën zijn; dat doe je met de functie levels(). Voor een tibble is het algemenere concept het vinden van rijen met unieke gegevens. In de terminologie van SQL doe je dit met de functie distinct(). Je kunt deze rechtstreeks op je gegevensset gebruiken, zodat je unieke combinaties van een bepaalde set kolommen vindt. Om bijvoorbeeld de unieke combinaties van waarden in de kolommen x, y en z te vinden, schrijf je het volgende.
a_tibble %>%
distinct(x, y, z)
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble gekoppeld aan de trackmetadata die in Spark is opgeslagen, is vooraf gedefinieerd als track_metadata_tbl.
- Zoek de unieke waarden van de kolom
artist_nameuittrack_metadata_tbl.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___