Aan de slagBegin gratis

Kolommen samenvatten

De functie mutate() die je in de vorige oefening zag, neemt kolommen als invoer en geeft een kolom terug. Als je samenvattende statistieken zoals het gemiddelde, maximum of de standaardafwijking berekent, wil je meestal kolommen als invoer nemen maar één enkele waarde teruggeven. Dat doe je met de functie summarize().

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

Let op: dplyr heeft de filosofie (overgenomen door sparklyr) om gegevens altijd in tibbles te houden. De geretourneerde waarde is hier dus een tibble met één rij en één kolom voor elke berekende samenvattende statistiek.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Er is al een Spark-verbinding voor je aangemaakt als spark_conn. Een tibble gekoppeld aan de trackmetadata die in Spark is opgeslagen, is vooraf gedefinieerd als track_metadata_tbl.

  • Selecteer de velden title en duration.
  • Pipe het resultaat om een nieuw veld duration_minutes te maken, met de trackduur in minuten.
  • Pipe het resultaat naar summarize() om de gemiddelde duur in minuten te berekenen, in een veld met de naam mean_duration_minutes.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
Code bewerken en uitvoeren