Filtrowanie DataFrame
W poprzednim ćwiczeniu wybrałeś podzbiór danych za pomocą operatora select(), który służy głównie do zawężania DataFrame do wybranych kolumn. Co jednak zrobić, gdy chcesz wybrać wiersze spełniające określony warunek (na przykład wszystkie wiersze, w których płeć to kobieta)? W tym ćwiczeniu przefiltruj wiersze DataFrame people_df według wartości kolumny 'sex' – osobno dla kobiet i mężczyzn – tworząc dwa oddzielne zbiory danych. Na koniec policz liczbę wierszy w każdym z nich.
Pamiętaj, że w obszarze roboczym masz już dostępne: SparkSession spark oraz DataFrame people_df.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Przefiltruj DataFrame
people_df, aby wybrać wszystkie wiersze, w których płeć to kobieta, i zapisz wynik do DataFramepeople_df_female. - Przefiltruj DataFrame
people_df, aby wybrać wszystkie wiersze, w których płeć to mężczyzna, i zapisz wynik do DataFramepeople_df_male. - Policz liczbę wierszy w DataFrame
people_df_femaleipeople_df_male.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Filter people_df to select females
people_df_female = people_df.____(people_df.____ == "female")
# Filter people_df to select males
people_df_male = people_df.____(____ == "____")
# Count the number of rows
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))