Inizia subitoInizia gratis

Convalida le righe tramite join

Un altro modo per filtrare i dati è usare i join per rimuovere le voci non valide. Devi verificare che i nomi delle cartelle siano quelli attesi in base a un DataFrame chiamato valid_folders_df. Il DataFrame split_df è rimasto come lo avevi lasciato, con un gruppo di colonne derivate da uno split.

L'oggetto spark è disponibile e pyspark.sql.functions è importato come F.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Rinomina la colonna _c0 in folder nel DataFrame valid_folders_df.
  • Conta il numero di righe in split_df.
  • Esegui il join dei due DataFrame sul nome della cartella e chiama joined_df il DataFrame risultante. Assicurati di eseguire il broadcast del DataFrame più piccolo.
  • Controlla quante righe restano nel DataFrame e confrontale.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
Modifica ed esegui il codice