Moeders kleine hulpje (1)
Als je gegevensset duizenden kolommen heeft en je er veel wilt selecteren, is het erg tijdrovend om bij elke select()-aanroep alle kolomnamen te typen. Gelukkig heeft select() een aantal helperfuncties waarmee je eenvoudig meerdere kolommen kunt kiezen zonder veel code te schrijven.
Deze helpers bevatten onder andere starts_with() en ends_with(), die respectievelijk kolommen matchen die beginnen of eindigen met een bepaalde prefix of suffix. Door de speciale code-evaluatie van dplyr kunnen deze functies alleen binnen een select()-aanroep gebruikt worden; op zichzelf hebben ze geen zin.
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble gekoppeld aan de trackmetadata die in Spark is opgeslagen is vooraf gedefinieerd als track_metadata_tbl.
- Selecteer alle kolommen uit
track_metadata_tbldie beginnen met"artist". - Selecteer alle kolommen uit
track_metadata_tbldie eindigen op"id".
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select columns starting with artist
___
track_metadata_tbl %>%
# Select columns ending with id
___