Kom igångKom igång gratis

Skriva Spark-konfigurationer

Nu när du har granskat några av Spark-konfigurationerna på ditt kluster vill du ändra vissa inställningar för att anpassa Spark efter dina behov. Du importerar data för att kontrollera att ändringarna har påverkat klustret.

Spark-konfigurationen är inledningsvis inställd på standardvärdet 200 partitioner.

Objektet spark är tillgängligt för användning. En fil med namnet departures.txt.gz finns tillgänglig för import. En initial DataFrame med de distinkta raderna från departures.txt.gz finns tillgänglig som departures_df.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Lagra antalet partitioner i departures_df i variabeln before.
  • Ändra konfigurationen spark.sql.shuffle.partitions till 500 partitioner.
  • Återskapa DataFrame departures_df genom att läsa de distinkta raderna från avgångsfilen.
  • Skriv ut antalet partitioner före och efter konfigurationsändringen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Redigera och kör kod