Modifier des colonnes
Cela peut vous surprendre, mais bien des jeux de données ne sont pas parfaitement propres au départ ! Vous devez souvent corriger des valeurs ou créer de nouvelles colonnes à partir des données existantes. Dans la terminologie de dplyr, le processus qui consiste à modifier ou ajouter des colonnes s'appelle une « mutation » et s'effectue avec mutate(). Cette fonction prend un tibble et des arguments nommés pour mettre à jour des colonnes. Le nom de chaque argument correspond au nom de la colonne à modifier ou à ajouter, et sa valeur est une expression qui indique comment la mettre à jour. Par exemple, pour un tibble avec les colonnes x et y, le code suivant mettrait à jour x et créerait une nouvelle colonne z.
a_tibble %>%
mutate(
x = x + y,
z = log(x)
)
Au cas où le message ne serait pas encore clair : les fonctions de base R ne fonctionnent pas avec les tibbles Spark. Vous ne pouvez donc pas utiliser within() ni transform() à cette fin.
Cette activité fait partie du cours
Introduction à Spark avec sparklyr en R
Instructions de l’exercice
Une connexion Spark a été créée pour vous sous le nom spark_conn. Un tibble relié aux métadonnées des pistes stockées dans Spark a été préalablement défini sous le nom track_metadata_tbl.
- Sélectionnez les champs
titleetduration. Notez que les durées sont en secondes. - Faites passer le résultat à
mutate()pour créer un nouveau champ,duration_minutes, qui contient la durée de la piste en minutes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___ %>%
# Mutate columns
___