Aan de slagBegin gratis

Moeders kleine hulpje (1)

Als je gegevensset duizenden kolommen heeft en je er veel wilt selecteren, is het erg tijdrovend om bij elke select()-aanroep alle kolomnamen te typen. Gelukkig heeft select() een aantal helperfuncties waarmee je eenvoudig meerdere kolommen kunt kiezen zonder veel code te schrijven.

Deze helpers bevatten onder andere starts_with() en ends_with(), die respectievelijk kolommen matchen die beginnen of eindigen met een bepaalde prefix of suffix. Door de speciale code-evaluatie van dplyr kunnen deze functies alleen binnen een select()-aanroep gebruikt worden; op zichzelf hebben ze geen zin.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble gekoppeld aan de trackmetadata die in Spark is opgeslagen is vooraf gedefinieerd als track_metadata_tbl.

  • Selecteer alle kolommen uit track_metadata_tbl die beginnen met "artist".
  • Selecteer alle kolommen uit track_metadata_tbl die eindigen op "id".

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select columns starting with artist
  ___

track_metadata_tbl %>%
  # Select columns ending with id
  ___
Code bewerken en uitvoeren