Kolommen samenvatten
De functie mutate() die je in de vorige oefening zag, neemt kolommen als invoer en geeft een kolom terug. Als je samenvattende statistieken zoals het gemiddelde, maximum of de standaardafwijking berekent, wil je meestal kolommen als invoer nemen maar één enkele waarde teruggeven. Dat doe je met de functie summarize().
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
Let op: dplyr heeft de filosofie (overgenomen door sparklyr) om gegevens altijd in tibbles te houden. De geretourneerde waarde is hier dus een tibble met één rij en één kolom voor elke berekende samenvattende statistiek.
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble gekoppeld aan de trackmetadata die in Spark is opgeslagen, is vooraf gedefinieerd als track_metadata_tbl.
- Selecteer de velden
titleenduration. - Pipe het resultaat om een nieuw veld
duration_minuteste maken, met de trackduur in minuten. - Pipe het resultaat naar
summarize()om de gemiddelde duur in minuten te berekenen, in een veld met de naammean_duration_minutes.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___