Zacznij terazZacznij za darmo

Konfigurowanie ustawień Sparka

Po przejrzeniu konfiguracji Sparka w swoim klastrze chcesz zmodyfikować niektóre ustawienia, aby dostosować go do swoich potrzeb. Zaimportujesz dane, żeby sprawdzić, czy wprowadzone zmiany wpłynęły na klaster.

Konfiguracja Sparka jest początkowo ustawiona na domyślną wartość 200 partycji.

Obiekt spark jest dostępny do użycia. Plik o nazwie departures.txt.gz jest dostępny do zaimportowania. Wstępnie przygotowany DataFrame zawierający unikalne wiersze z pliku departures.txt.gz jest dostępny jako departures_df.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zapisz liczbę partycji w departures_df w zmiennej before.
  • Zmień konfigurację spark.sql.shuffle.partitions na 500 partycji.
  • Utwórz ponownie DataFrame departures_df, odczytując unikalne wiersze z pliku z odlotami.
  • Wyświetl liczbę partycji sprzed zmiany konfiguracji i po niej.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Edytuj i uruchom kod