CommencezCommencez gratuitement

Filtrer votre DataFrame

Dans l'exercice précédent, vous avez sous-ensemble les données avec l'opérateur select(), principalement utilisé pour extraire des colonnes d'un DataFrame. Mais si vous voulez sous-ensemble le DataFrame selon une condition (par exemple, sélectionner toutes les lignes où le sexe est « Female »)? Dans cet exercice, vous allez filtrer les lignes du DataFrame people_df où « sex » est female et male et créer deux ensembles de données distincts. Finalement, vous compterez le nombre de lignes dans chacun de ces ensembles.

Rappel : vous disposez déjà d'un SparkSession spark et d'un DataFrame people_df dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Filtrez le DataFrame people_df pour sélectionner toutes les lignes où sex est female dans le DataFrame people_df_female.
  • Filtrez le DataFrame people_df pour sélectionner toutes les lignes où sex est male dans le DataFrame people_df_male.
  • Comptez le nombre de lignes dans les DataFrames people_df_female et people_df_male.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Filter people_df to select females 
people_df_female = people_df.____(people_df.____ == "female")

# Filter people_df to select males
people_df_male = people_df.____(____ == "____")

# Count the number of rows 
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))
Modifier et exécuter le code