Konfigurowanie ustawień Sparka
Po przejrzeniu konfiguracji Sparka w swoim klastrze chcesz zmodyfikować niektóre ustawienia, aby dostosować go do swoich potrzeb. Zaimportujesz dane, żeby sprawdzić, czy wprowadzone zmiany wpłynęły na klaster.
Konfiguracja Sparka jest początkowo ustawiona na domyślną wartość 200 partycji.
Obiekt spark jest dostępny do użycia. Plik o nazwie departures.txt.gz jest dostępny do zaimportowania. Wstępnie przygotowany DataFrame zawierający unikalne wiersze z pliku departures.txt.gz jest dostępny jako departures_df.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Zapisz liczbę partycji w
departures_dfw zmiennejbefore. - Zmień konfigurację
spark.sql.shuffle.partitionsna 500 partycji. - Utwórz ponownie DataFrame
departures_df, odczytując unikalne wiersze z pliku z odlotami. - Wyświetl liczbę partycji sprzed zmiany konfiguracji i po niej.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)