Résumer des colonnes
La fonction mutate() que vous avez vue dans l'exercice précédent prend des colonnes en entrée et retourne une colonne. Si vous calculez des statistiques sommaires comme la moyenne, le maximum ou l'écart-type, vous souhaitez généralement prendre des colonnes en entrée mais retourner une seule valeur. Cela se fait avec la fonction summarize().
a_tibble %>%
summarize(
mean_x = mean(x),
sd_x_times_y = sd(x * y)
)
Notez que dplyr a pour philosophie (transmise à sparklyr) de toujours conserver les données sous forme de tibbles. Ainsi, la valeur de retour ici est un tibble à une seule ligne, avec une colonne pour chaque statistique sommaire calculée.
Cette activité fait partie du cours
Introduction à Spark avec sparklyr en R
Instructions de l’exercice
Une connexion Spark a été créée pour vous sous le nom spark_conn. Un tibble rattaché aux métadonnées des pistes stockées dans Spark a été prédefini sous le nom track_metadata_tbl.
- Sélectionnez les champs
titleetduration. - Faites suivre le résultat d'un tuyau pour créer un nouveau champ,
duration_minutes, qui contient la durée de la piste en minutes. - Faites ensuite suivre le résultat de
summarize()pour calculer la durée moyenne en minutes, dans un champ nommémean_duration_minutes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___ %>%
# Summarize columns
___