Začněte nyníZačněte zdarma

Nastavení konfigurace Sparku

Teď, když sis prošel/a některá nastavení konfigurace Sparku na svém clusteru, chceš upravit část z nich tak, aby Spark lépe vyhovoval tvým potřebám. Naimportuješ data a ověříš, že provedené změny se na clusteru skutečně projevily.

Konfigurace Sparku je zpočátku nastavena na výchozí hodnotu 200 oddílů.

K dispozici máš objekt spark. Soubor departures.txt.gz je připraven k importu. Jako departures_df je dostupný počáteční DataFrame obsahující unikátní řádky ze souboru departures.txt.gz.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Ulož počet oddílů v departures_df do proměnné before.
  • Změň konfiguraci spark.sql.shuffle.partitions na 500 oddílů.
  • Znovu vytvoř DataFrame departures_df načtením unikátních řádků ze souboru s odlety.
  • Vypiš počet oddílů před změnou konfigurace i po ní.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Upravit a spustit kód