Filtrarea DataFrame-ului
În exercițiul anterior, ai selectat un subset din date folosind operatorul select(), care este utilizat în principal pentru a filtra coloanele unui DataFrame. Dar ce faci dacă vrei să selectezi rânduri pe baza unei condiții (de exemplu, toate rândurile în care sexul este feminin)? În acest exercițiu, vei filtra rândurile din DataFrame-ul people_df după valorile „female" și „male" ale coloanei „sex" și vei crea două seturi de date distincte. La final, vei număra câte rânduri conține fiecare dintre aceste seturi.
Amintește-ți că ai deja o sesiune SparkSession spark și un DataFrame people_df disponibile în spațiul de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Filtrează DataFrame-ul
people_dfpentru a selecta toate rândurile în care sexul este feminin și salvează rezultatul în DataFrame-ulpeople_df_female. - Filtrează DataFrame-ul
people_dfpentru a selecta toate rândurile în care sexul este masculin și salvează rezultatul în DataFrame-ulpeople_df_male. - Numără rândurile din DataFrame-urile
people_df_femaleșipeople_df_male.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Filter people_df to select females
people_df_female = people_df.____(people_df.____ == "female")
# Filter people_df to select males
people_df_male = people_df.____(____ == "____")
# Count the number of rows
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))