Zacznij terazZacznij za darmo

Filtrowanie DataFrame

W poprzednim ćwiczeniu wybrałeś podzbiór danych za pomocą operatora select(), który służy głównie do zawężania DataFrame do wybranych kolumn. Co jednak zrobić, gdy chcesz wybrać wiersze spełniające określony warunek (na przykład wszystkie wiersze, w których płeć to kobieta)? W tym ćwiczeniu przefiltruj wiersze DataFrame people_df według wartości kolumny 'sex' – osobno dla kobiet i mężczyzn – tworząc dwa oddzielne zbiory danych. Na koniec policz liczbę wierszy w każdym z nich.

Pamiętaj, że w obszarze roboczym masz już dostępne: SparkSession spark oraz DataFrame people_df.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Przefiltruj DataFrame people_df, aby wybrać wszystkie wiersze, w których płeć to kobieta, i zapisz wynik do DataFrame people_df_female.
  • Przefiltruj DataFrame people_df, aby wybrać wszystkie wiersze, w których płeć to mężczyzna, i zapisz wynik do DataFrame people_df_male.
  • Policz liczbę wierszy w DataFrame people_df_female i people_df_male.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Filter people_df to select females 
people_df_female = people_df.____(people_df.____ == "female")

# Filter people_df to select males
people_df_male = people_df.____(____ == "____")

# Count the number of rows 
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))
Edytuj i uruchom kod