Esaminare le righe non valide
Sei riuscito a filtrare le righe usando un join, ma a volte può essere utile esaminare i dati non validi. Questi dati possono essere archiviati per una successiva elaborazione o per la diagnosi delle origini dati.
Vuoi trovare la differenza tra due DataFrame e salvare le righe non valide.
L'oggetto spark è definito e pyspark.sql.functions è importato come F. Il DataFrame originale split_df e il DataFrame joined_df risultante dal join sono disponibili come nei loro stati precedenti.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Determina il numero di righe per ciascun DataFrame.
- Crea un DataFrame contenente solo le righe non valide.
- Verifica che il conteggio del nuovo DataFrame sia quello atteso.
- Determina il numero di righe di cartelle distinte rimosse.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____
# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')
# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))
# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)