Weryfikacja wierszy za pomocą złączenia
Kolejnym sposobem filtrowania danych jest używanie złączeń do usuwania nieprawidłowych wpisów. Zweryfikuj nazwy folderów na podstawie DataFrame o nazwie valid_folders_df. DataFrame split_df zawiera kolumny podzielone tak, jak je ostatnio zostawiłeś.
Obiekt spark jest dostępny, a pyspark.sql.functions jest zaimportowany jako F.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Zmień nazwę kolumny
_c0nafolderw DataFramevalid_folders_df. - Policz liczbę wierszy w
split_df. - Złącz oba DataFrame po nazwie folderu i nadaj wynikowemu DataFrame nazwę
joined_df. Pamiętaj, aby użyć broadcast dla mniejszego DataFrame. - Sprawdź, ile wierszy pozostało w DataFrame, i porównaj wynik.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))