Configurarea Spark
Acum că ai analizat câteva dintre configurările Spark pe clusterul tău, vrei să modifici unele setări pentru a adapta Spark la nevoile tale. Vei importa date pentru a verifica că modificările au avut efect asupra clusterului.
Configurarea Spark este inițial setată la valoarea implicită de 200 de partiții.
Obiectul spark este disponibil pentru utilizare. Un fișier numit departures.txt.gz este disponibil pentru import. Un DataFrame inițial care conține rândurile distincte din departures.txt.gz este disponibil ca departures_df.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Stochează numărul de partiții din
departures_dfîn variabilabefore. - Modifică configurarea
spark.sql.shuffle.partitionsla 500 de partiții. - Recreează DataFrame-ul
departures_dfcitind rândurile distincte din fișierul de plecări. - Afișează numărul de partiții înainte și după modificarea configurării.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)