Inizia subitoInizia gratis

Scrivere configurazioni di Spark

Ora che hai passato in rassegna alcune configurazioni di Spark nel tuo cluster, vuoi modificare alcune impostazioni per adattare Spark alle tue esigenze. Importerai dei dati per verificare che le modifiche abbiano effettivamente avuto effetto sul cluster.

La configurazione di Spark è inizialmente impostata sul valore predefinito di 200 partizioni.

L'oggetto spark è disponibile. È disponibile per l'import un file chiamato departures.txt.gz. Un DataFrame iniziale con le righe distinte da departures.txt.gz è disponibile come departures_df.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Salva il numero di partizioni di departures_df nella variabile before.
  • Modifica la configurazione spark.sql.shuffle.partitions a 500 partizioni.
  • Ricrea il DataFrame departures_df leggendo le righe distinte dal file delle partenze.
  • Stampa il numero di partizioni prima e dopo la modifica della configurazione.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Modifica ed esegui il codice