Sous-ensemble et nettoyage d'un DataFrame PySpark
Après l'inspection des données, il est souvent nécessaire de les nettoyer : cela implique surtout de créer des sous-ensembles, de renommer des colonnes, de supprimer les lignes en double, etc. L'API DataFrame de PySpark fournit plusieurs opérations pour y arriver. Dans cet exercice, vous devez extraire les colonnes « name », « sex » et « date of birth » du DataFrame people_df, supprimer les lignes en double de cet ensemble de données, puis compter le nombre de lignes avant et après la suppression des doublons.
Rappel : vous disposez déjà d'une SparkSession spark et d'un DataFrame people_df dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Sélectionnez les colonnes « name », « sex » et « date of birth » de
people_dfet créez le DataFramepeople_df_sub. - Affichez les 10 premières observations du DataFrame
people_df_sub. - Supprimez les entrées en double du DataFrame
people_df_subet créez le DataFramepeople_df_sub_nodup. - Combien de lignes y a-t-il avant et après la suppression des doublons?
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)
# Print the first 10 observations from people_df_sub
people_df_sub.____(____)
# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()
# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))