Kolommen selecteren
De makkelijkste manier om dataframes die in Spark staan te bewerken, is met dplyr-syntaxis. Werken met dataframes met dplyr komt uitgebreid aan bod in de cursussen Data Manipulation with dplyr en Joining Data with dplyr, maar in het komende hoofdstuk en een half behandel je alle belangrijke punten.
dplyr heeft vijf hoofdacties die je op een dataframe kunt uitvoeren. Je kunt kolommen selecteren, rijen filteren, de volgorde van rijen aanpassen, kolommen wijzigen of nieuwe kolommen toevoegen, en samenvattende statistieken berekenen.
Laten we beginnen met kolommen selecteren. Dit doe je door select() aan te roepen met een tibble, gevolgd door de ongenoteerde namen van de kolommen die je wilt behouden. dplyr-functies gebruik je doorgaans met de pipe-operator van magrittr, %>%. Om de kolommen x, y en z te selecteren, schrijf je het volgende.
a_tibble %>%
select(x, y, z)
Let op: indexeren met blokhaken wordt momenteel niet ondersteund in sparklyr. Je kunt dus niet
a_tibble[, c("x", "y", "z")]
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble die is gekoppeld aan de trackmetadata in Spark is vooraf gedefinieerd als track_metadata_tbl.
- Selecteer
artist_name,release,titleenyearmetselect(). - Probeer hetzelfde te doen met indexeren via blokhaken. Spoiler! Deze code geeft een fout en is daarom verpakt in een aanroep van
tryCatch().
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)