ÎncepețiÎncepe gratuit

Filtrarea DataFrame-ului

În exercițiul anterior, ai selectat un subset din date folosind operatorul select(), care este utilizat în principal pentru a filtra coloanele unui DataFrame. Dar ce faci dacă vrei să selectezi rânduri pe baza unei condiții (de exemplu, toate rândurile în care sexul este feminin)? În acest exercițiu, vei filtra rândurile din DataFrame-ul people_df după valorile „female" și „male" ale coloanei „sex" și vei crea două seturi de date distincte. La final, vei număra câte rânduri conține fiecare dintre aceste seturi.

Amintește-ți că ai deja o sesiune SparkSession spark și un DataFrame people_df disponibile în spațiul de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Filtrează DataFrame-ul people_df pentru a selecta toate rândurile în care sexul este feminin și salvează rezultatul în DataFrame-ul people_df_female.
  • Filtrează DataFrame-ul people_df pentru a selecta toate rândurile în care sexul este masculin și salvează rezultatul în DataFrame-ul people_df_male.
  • Numără rândurile din DataFrame-urile people_df_female și people_df_male.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Filter people_df to select females 
people_df_female = people_df.____(people_df.____ == "female")

# Filter people_df to select males
people_df_male = people_df.____(____ == "____")

# Count the number of rows 
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))
Editează și rulează codul