Skriva Spark-konfigurationer
Nu när du har granskat några av Spark-konfigurationerna på ditt kluster vill du ändra vissa inställningar för att anpassa Spark efter dina behov. Du importerar data för att kontrollera att ändringarna har påverkat klustret.
Spark-konfigurationen är inledningsvis inställd på standardvärdet 200 partitioner.
Objektet spark är tillgängligt för användning. En fil med namnet departures.txt.gz finns tillgänglig för import. En initial DataFrame med de distinkta raderna från departures.txt.gz finns tillgänglig som departures_df.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Lagra antalet partitioner i
departures_dfi variabelnbefore. - Ändra konfigurationen
spark.sql.shuffle.partitionstill 500 partitioner. - Återskapa DataFrame
departures_dfgenom att läsa de distinkta raderna från avgångsfilen. - Skriv ut antalet partitioner före och efter konfigurationsändringen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)