Filtrowanie i czyszczenie danych w PySpark DataFrame
Po inspekcji danych często konieczne jest ich wyczyszczenie – obejmuje to m.in. wybieranie kolumn, zmianę ich nazw oraz usuwanie zduplikowanych wierszy. API PySpark DataFrame udostępnia kilka operatorów, które to umożliwiają. W tym ćwiczeniu wybierzesz kolumny 'name', 'sex' i 'date of birth' z DataFrame people_df, usuniesz zduplikowane wiersze i porównasz liczbę wierszy przed i po ich usunięciu.
Pamiętaj, że w przestrzeni roboczej masz już dostępną sesję SparkSession spark oraz DataFrame people_df.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Wybierz kolumny 'name', 'sex' i 'date of birth' z
people_dfi utwórz DataFramepeople_df_sub. - Wyświetl pierwsze 10 obserwacji z DataFrame
people_df_sub. - Usuń zduplikowane wiersze z DataFrame
people_df_subi utwórz DataFramepeople_df_sub_nodup. - Ile wierszy jest przed usunięciem duplikatów i ile po tym kroku?
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)
# Print the first 10 observations from people_df_sub
people_df_sub.____(____)
# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()
# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))