CommencezCommencez gratuitement

Sous-ensemble et nettoyage d'un DataFrame PySpark

Après l'inspection des données, il est souvent nécessaire de les nettoyer : cela implique surtout de créer des sous-ensembles, de renommer des colonnes, de supprimer les lignes en double, etc. L'API DataFrame de PySpark fournit plusieurs opérations pour y arriver. Dans cet exercice, vous devez extraire les colonnes « name », « sex » et « date of birth » du DataFrame people_df, supprimer les lignes en double de cet ensemble de données, puis compter le nombre de lignes avant et après la suppression des doublons.

Rappel : vous disposez déjà d'une SparkSession spark et d'un DataFrame people_df dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Sélectionnez les colonnes « name », « sex » et « date of birth » de people_df et créez le DataFrame people_df_sub.
  • Affichez les 10 premières observations du DataFrame people_df_sub.
  • Supprimez les entrées en double du DataFrame people_df_sub et créez le DataFrame people_df_sub_nodup.
  • Combien de lignes y a-t-il avant et après la suppression des doublons?

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)

# Print the first 10 observations from people_df_sub
people_df_sub.____(____)

# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()

# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))
Modifier et exécuter le code