CommencezCommencez gratuitement

Sélectionner des lignes uniques

Si vous avez une variable catégorielle stockée dans un facteur, il est souvent utile de connaître les catégories individuelles; pour cela, on utilise la fonction levels(). Pour une tibble, le concept plus général consiste à repérer les lignes contenant des données uniques. En reprenant la terminologie SQL, on utilise la fonction distinct(). Vous pouvez l'appliquer directement à votre jeu de données pour obtenir les combinaisons uniques d'un ensemble particulier de colonnes. Par exemple, pour trouver les combinaisons uniques de valeurs dans les colonnes x, y et z, vous écririez ce qui suit.

a_tibble %>%
  distinct(x, y, z)

Cette activité fait partie du cours

Introduction à Spark avec sparklyr en R

Voir le cours

Instructions de l’exercice

Une connexion Spark a été créée pour vous sous le nom spark_conn. Une tibble liée aux métadonnées des pistes stockées dans Spark a été préalablement définie sous le nom track_metadata_tbl.

  • Trouvez les valeurs distinctes de la colonne artist_name dans track_metadata_tbl.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
Modifier et exécuter le code