Inizia subitoInizia gratis

Esaminare le righe non valide

Sei riuscito a filtrare le righe usando un join, ma a volte può essere utile esaminare i dati non validi. Questi dati possono essere archiviati per una successiva elaborazione o per la diagnosi delle origini dati.

Vuoi trovare la differenza tra due DataFrame e salvare le righe non valide.

L'oggetto spark è definito e pyspark.sql.functions è importato come F. Il DataFrame originale split_df e il DataFrame joined_df risultante dal join sono disponibili come nei loro stati precedenti.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Determina il numero di righe per ciascun DataFrame.
  • Crea un DataFrame contenente solo le righe non valide.
  • Verifica che il conteggio del nuovo DataFrame sia quello atteso.
  • Determina il numero di righe di cartelle distinte rimosse.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
Modifica ed esegui il codice