Analiza nieprawidłowych wierszy
Udało ci się odfiltrować wiersze za pomocą złączenia, ale czasem warto przyjrzeć się danym, które są nieprawidłowe. Takie dane można zapisać do późniejszego przetworzenia lub do diagnostyki źródeł danych.
Chcesz znaleźć różnicę między dwoma DataFrames i zachować nieprawidłowe wiersze.
Obiekt spark jest zdefiniowany, a pyspark.sql.functions jest zaimportowany jako F. Oryginalny DataFrame split_df oraz złączony DataFrame joined_df są dostępne w swoich poprzednich stanach.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Określ liczbę wierszy w każdym DataFrame.
- Utwórz DataFrame zawierający wyłącznie nieprawidłowe wiersze.
- Sprawdź, czy liczba wierszy w nowym DataFrame jest zgodna z oczekiwaniami.
- Ustal liczbę usuniętych unikalnych wierszy z kolumny folderów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____
# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')
# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))
# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)