Kom igångKom igång gratis

Undersöka ogiltiga rader

Du har filtrerat bort rader med hjälp av en join, men ibland vill du även granska den ogiltiga datan. Den kan sparas för senare bearbetning eller för felsökning av dina datakällor.

Målet är att hitta skillnaden mellan två DataFrames och lagra de ogiltiga raderna.

Objektet spark är definierat och pyspark.sql.functions är importerat som F. Den ursprungliga DataFramen split_df och den joinade DataFramen joined_df är tillgängliga i sina tidigare tillstånd.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Bestäm antalet rader i varje DataFrame.
  • Skapa en DataFrame som bara innehåller de ogiltiga raderna.
  • Verifiera att antalet rader i den nya DataFramen stämmer med förväntningen.
  • Bestäm antalet distinkta mapprader som togs bort.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
Redigera och kör kod