Filtrer votre DataFrame
Dans l'exercice précédent, vous avez sous-ensemble les données avec l'opérateur select(), principalement utilisé pour extraire des colonnes d'un DataFrame. Mais si vous voulez sous-ensemble le DataFrame selon une condition (par exemple, sélectionner toutes les lignes où le sexe est « Female »)? Dans cet exercice, vous allez filtrer les lignes du DataFrame people_df où « sex » est female et male et créer deux ensembles de données distincts. Finalement, vous compterez le nombre de lignes dans chacun de ces ensembles.
Rappel : vous disposez déjà d'un SparkSession spark et d'un DataFrame people_df dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Filtrez le DataFrame
people_dfpour sélectionner toutes les lignes où sex est female dans le DataFramepeople_df_female. - Filtrez le DataFrame
people_dfpour sélectionner toutes les lignes où sex est male dans le DataFramepeople_df_male. - Comptez le nombre de lignes dans les DataFrames
people_df_femaleetpeople_df_male.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Filter people_df to select females
people_df_female = people_df.____(people_df.____ == "female")
# Filter people_df to select males
people_df_male = people_df.____(____ == "____")
# Count the number of rows
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))