Zacznij terazZacznij za darmo

Filtrowanie i czyszczenie danych w PySpark DataFrame

Po inspekcji danych często konieczne jest ich wyczyszczenie – obejmuje to m.in. wybieranie kolumn, zmianę ich nazw oraz usuwanie zduplikowanych wierszy. API PySpark DataFrame udostępnia kilka operatorów, które to umożliwiają. W tym ćwiczeniu wybierzesz kolumny 'name', 'sex' i 'date of birth' z DataFrame people_df, usuniesz zduplikowane wiersze i porównasz liczbę wierszy przed i po ich usunięciu.

Pamiętaj, że w przestrzeni roboczej masz już dostępną sesję SparkSession spark oraz DataFrame people_df.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wybierz kolumny 'name', 'sex' i 'date of birth' z people_df i utwórz DataFrame people_df_sub.
  • Wyświetl pierwsze 10 obserwacji z DataFrame people_df_sub.
  • Usuń zduplikowane wiersze z DataFrame people_df_sub i utwórz DataFrame people_df_sub_nodup.
  • Ile wierszy jest przed usunięciem duplikatów i ile po tym kroku?

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)

# Print the first 10 observations from people_df_sub
people_df_sub.____(____)

# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()

# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))
Edytuj i uruchom kod