Nastavení konfigurace Sparku
Teď, když sis prošel/a některá nastavení konfigurace Sparku na svém clusteru, chceš upravit část z nich tak, aby Spark lépe vyhovoval tvým potřebám. Naimportuješ data a ověříš, že provedené změny se na clusteru skutečně projevily.
Konfigurace Sparku je zpočátku nastavena na výchozí hodnotu 200 oddílů.
K dispozici máš objekt spark. Soubor departures.txt.gz je připraven k importu. Jako departures_df je dostupný počáteční DataFrame obsahující unikátní řádky ze souboru departures.txt.gz.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Ulož počet oddílů v
departures_dfdo proměnnébefore. - Změň konfiguraci
spark.sql.shuffle.partitionsna 500 oddílů. - Znovu vytvoř DataFrame
departures_dfnačtením unikátních řádků ze souboru s odlety. - Vypiš počet oddílů před změnou konfigurace i po ní.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)