CommencezCommencez gratuitement

Résumer des colonnes

La fonction mutate() que vous avez vue dans l'exercice précédent prend des colonnes en entrée et retourne une colonne. Si vous calculez des statistiques sommaires comme la moyenne, le maximum ou l'écart-type, vous souhaitez généralement prendre des colonnes en entrée mais retourner une seule valeur. Cela se fait avec la fonction summarize().

a_tibble %>%
  summarize(
    mean_x       = mean(x),
    sd_x_times_y = sd(x * y)
  )

Notez que dplyr a pour philosophie (transmise à sparklyr) de toujours conserver les données sous forme de tibbles. Ainsi, la valeur de retour ici est un tibble à une seule ligne, avec une colonne pour chaque statistique sommaire calculée.

Cette activité fait partie du cours

Introduction à Spark avec sparklyr en R

Voir le cours

Instructions de l’exercice

Une connexion Spark a été créée pour vous sous le nom spark_conn. Un tibble rattaché aux métadonnées des pistes stockées dans Spark a été prédefini sous le nom track_metadata_tbl.

  • Sélectionnez les champs title et duration.
  • Faites suivre le résultat d'un tuyau pour créer un nouveau champ, duration_minutes, qui contient la durée de la piste en minutes.
  • Faites ensuite suivre le résultat de summarize() pour calculer la durée moyenne en minutes, dans un champ nommé mean_duration_minutes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___ %>%
  # Mutate columns
  ___ %>%
  # Summarize columns
  ___
Modifier et exécuter le code