Mulai sekarangMulai gratis

Menyimpan dalam Cache sebuah DataFrame

Anda mendapat tugas yang mengharuskan menjalankan beberapa operasi analisis pada sebuah DataFrame. Anda mengetahui bahwa caching dapat meningkatkan kinerja saat menggunakan kembali DataFrame dan ingin menerapkannya.

Anda akan bekerja dengan himpunan data baru yang berisi informasi keberangkatan maskapai. Data ini mungkin memiliki pengulangan dan perlu dideduplikasi.

DataFrame departures_df sudah didefinisikan, tetapi belum ada aksi yang dijalankan.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Simpan dalam cache baris-baris unik pada DataFrame departures_df.
  • Lakukan kueri hitung pada departures_df, sambil mencatat berapa lama operasi berlangsung.
  • Hitung kembali baris-barisnya, sambil mencatat perbedaan waktu pada DataFrame yang telah di-cache.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Edit dan Jalankan Kode