Kolommen muteren
Het zal je misschien verbazen, maar niet alle gegevenssets zijn meteen perfect schoon! Vaak moet je waarden corrigeren of nieuwe kolommen maken op basis van je bestaande data. Het proces van kolommen wijzigen of toevoegen heet in de terminologie van dplyr een mutatie, en gebeurt met mutate(). Deze functie neemt een tibble en benoemde argumenten om kolommen bij te werken. De namen van deze argumenten zijn de namen van de kolommen die je wilt wijzigen of toevoegen, en de waarde is een expressie die uitlegt hoe je ze bijwerkt. Bijvoorbeeld, gegeven een tibble met kolommen x en y, werkt de volgende code x bij en maakt een nieuwe kolom z aan.
a_tibble %>%
mutate(
x = x + y,
z = log(x)
)
Mocht het nog niet duidelijk zijn dat basis-R-functies niet werken met Spark-tibbles: je kunt within() of transform() hier niet voor gebruiken.
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble gekoppeld aan de trackmetadata die in Spark is opgeslagen, is vooraf gedefinieerd als track_metadata_tbl.
- Selecteer de velden
titleenduration. Let op: de duur is in seconden. - Pipe het resultaat naar
mutate()om een nieuw veldduration_minuteste maken met de trackduur in minuten.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___