Delmängder och datarensning i PySpark DataFrame
Efter datagranskningen behöver man ofta rensa data, vilket bland annat innebär att ta ut delmängder, byta namn på kolumner och ta bort dubbletter. PySpark DataFrame API erbjuder flera operatorer för detta. I den här övningen ska du välja ut kolumnerna 'name', 'sex' och 'date of birth' från DataFrame people_df, ta bort eventuella dubbletter och räkna antalet rader före och efter borttagningen av dubbletter.
Kom ihåg att du redan har en SparkSession spark och ett DataFrame people_df tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Välj kolumnerna 'name', 'sex' och 'date of birth' från
people_dfoch skapa DataFramepeople_df_sub. - Skriv ut de första 10 raderna i DataFrame
people_df_sub. - Ta bort dubblettposter från DataFrame
people_df_suboch skapa DataFramepeople_df_sub_nodup. - Hur många rader finns det före respektive efter att dubbletterna har tagits bort?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Select name, sex and date of birth columns
people_df_sub = people_df.____('name', ____, ____)
# Print the first 10 observations from people_df_sub
people_df_sub.____(____)
# Remove duplicate entries from people_df_sub
people_df_sub_nodup = people_df_sub.____()
# Count the number of rows
print("There were {} rows before removing duplicates, and {} rows after removing duplicates".format(people_df_sub.____(), people_df_sub_nodup.____()))