ÎncepețiÎncepe gratuit

Configurarea Spark

Acum că ai analizat câteva dintre configurările Spark pe clusterul tău, vrei să modifici unele setări pentru a adapta Spark la nevoile tale. Vei importa date pentru a verifica că modificările au avut efect asupra clusterului.

Configurarea Spark este inițial setată la valoarea implicită de 200 de partiții.

Obiectul spark este disponibil pentru utilizare. Un fișier numit departures.txt.gz este disponibil pentru import. Un DataFrame inițial care conține rândurile distincte din departures.txt.gz este disponibil ca departures_df.

Acest exercițiu face parte din cursul

Curățarea datelor cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Stochează numărul de partiții din departures_df în variabila before.
  • Modifică configurarea spark.sql.shuffle.partitions la 500 de partiții.
  • Recreează DataFrame-ul departures_df citind rândurile distincte din fișierul de plecări.
  • Afișează numărul de partiții înainte și după modificarea configurării.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Editează și rulează codul