Kom igångKom igång gratis

ID:n med olika partitioner

Du har precis lagt till ett ID-fält i en DataFrame. Nu ska du se vad som händer när du gör samma sak med DataFrames som innehåller olika antal partitioner.

Använd metoden .rdd.getNumPartitions() på en DataFrame för att kontrollera antalet partitioner.

Spark-sessionen spark och två DataFrames, voter_df och voter_df_single, finns tillgängliga i din arbetsyta. Instruktionerna hjälper dig att upptäcka skillnaden mellan DataFrames. Biblioteket pyspark.sql.functions är tillgängligt under aliaset F.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Skriv ut antalet partitioner för varje DataFrame.
  • Lägg till ett ROW_ID-fält i varje DataFrame.
  • Visa de 10 första ID:na i varje DataFrame.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)

# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____

# Show the top 10 IDs in each DataFrame 
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)
Redigera och kör kod