Zacznij terazZacznij za darmo

Weryfikacja wierszy za pomocą złączenia

Kolejnym sposobem filtrowania danych jest używanie złączeń do usuwania nieprawidłowych wpisów. Zweryfikuj nazwy folderów na podstawie DataFrame o nazwie valid_folders_df. DataFrame split_df zawiera kolumny podzielone tak, jak je ostatnio zostawiłeś.

Obiekt spark jest dostępny, a pyspark.sql.functions jest zaimportowany jako F.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zmień nazwę kolumny _c0 na folder w DataFrame valid_folders_df.
  • Policz liczbę wierszy w split_df.
  • Złącz oba DataFrame po nazwie folderu i nadaj wynikowemu DataFrame nazwę joined_df. Pamiętaj, aby użyć broadcast dla mniejszego DataFrame.
  • Sprawdź, ile wierszy pozostało w DataFrame, i porównaj wynik.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
Edytuj i uruchom kod