Sélectionner des lignes uniques
Si vous avez une variable catégorielle stockée dans un facteur, il est souvent utile de connaître les catégories individuelles; pour cela, on utilise la fonction levels(). Pour une tibble, le concept plus général consiste à repérer les lignes contenant des données uniques. En reprenant la terminologie SQL, on utilise la fonction distinct(). Vous pouvez l'appliquer directement à votre jeu de données pour obtenir les combinaisons uniques d'un ensemble particulier de colonnes. Par exemple, pour trouver les combinaisons uniques de valeurs dans les colonnes x, y et z, vous écririez ce qui suit.
a_tibble %>%
distinct(x, y, z)
Cette activité fait partie du cours
Introduction à Spark avec sparklyr en R
Instructions de l’exercice
Une connexion Spark a été créée pour vous sous le nom spark_conn. Une tibble liée aux métadonnées des pistes stockées dans Spark a été préalablement définie sous le nom track_metadata_tbl.
- Trouvez les valeurs distinctes de la colonne
artist_namedanstrack_metadata_tbl.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___