Mulai sekarangMulai gratis

Menulis konfigurasi Spark

Sekarang setelah Anda meninjau beberapa konfigurasi Spark pada kluster Anda, Anda ingin mengubah beberapa pengaturan untuk menyesuaikan Spark dengan kebutuhan Anda. Anda akan mengimpor beberapa data untuk meninjau bahwa perubahan Anda telah memengaruhi kluster.

Konfigurasi Spark awalnya disetel ke nilai default 200 partisi.

Objek spark tersedia untuk digunakan. Berkas bernama departures.txt.gz tersedia untuk diimpor. Sebuah DataFrame awal yang berisi baris-baris unik dari departures.txt.gz tersedia sebagai departures_df.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Simpan jumlah partisi di departures_df ke dalam variabel before.
  • Ubah konfigurasi spark.sql.shuffle.partitions menjadi 500 partisi.
  • Buat ulang DataFrame departures_df dengan membaca baris-baris unik dari berkas departures.
  • Cetak jumlah partisi sebelum dan sesudah perubahan konfigurasi.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Edit dan Jalankan Kode