ID:n med olika partitioner
Du har precis lagt till ett ID-fält i en DataFrame. Nu ska du se vad som händer när du gör samma sak med DataFrames som innehåller olika antal partitioner.
Använd metoden .rdd.getNumPartitions() på en DataFrame för att kontrollera antalet partitioner.
Spark-sessionen spark och två DataFrames, voter_df och voter_df_single, finns tillgängliga i din arbetsyta. Instruktionerna hjälper dig att upptäcka skillnaden mellan DataFrames. Biblioteket pyspark.sql.functions är tillgängligt under aliaset F.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Skriv ut antalet partitioner för varje DataFrame.
- Lägg till ett
ROW_ID-fält i varje DataFrame. - Visa de 10 första ID:na i varje DataFrame.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)
# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____
# Show the top 10 IDs in each DataFrame
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)