Kom igångKom igång gratis

Delmängder och datarensning i PySpark DataFrame

Efter datagranskningen behöver man ofta rensa data, vilket bland annat innebär att ta ut delmängder, byta namn på kolumner och ta bort dubbletter. PySpark DataFrame API erbjuder flera operatorer för detta. I den här övningen ska du välja ut kolumnerna 'name', 'sex' och 'date of birth' från DataFrame people_df, ta bort eventuella dubbletter och räkna antalet rader före och efter borttagningen av dubbletter.

Kom ihåg att du redan har en SparkSession spark och ett DataFrame people_df tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Välj kolumnerna 'name', 'sex' och 'date of birth' från people_df och skapa DataFrame people_df_sub.
  • Skriv ut de första 10 raderna i DataFrame people_df_sub.
  • Ta bort dubblettposter från DataFrame people_df_sub och skapa DataFrame people_df_sub_nodup.
  • Hur många rader finns det före respektive efter att dubbletterna har tagits bort?

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)

# Print the first 10 observations from people_df_sub
people_df_sub.____(____)

# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()

# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))
Redigera och kör kod