Menyimpan dalam Cache sebuah DataFrame
Anda mendapat tugas yang mengharuskan menjalankan beberapa operasi analisis pada sebuah DataFrame. Anda mengetahui bahwa caching dapat meningkatkan kinerja saat menggunakan kembali DataFrame dan ingin menerapkannya.
Anda akan bekerja dengan himpunan data baru yang berisi informasi keberangkatan maskapai. Data ini mungkin memiliki pengulangan dan perlu dideduplikasi.
DataFrame departures_df sudah didefinisikan, tetapi belum ada aksi yang dijalankan.
Latihan ini merupakan bagian dari kursus
Membersihkan Data dengan PySpark
Instruksi latihan
- Simpan dalam cache baris-baris unik pada DataFrame
departures_df. - Lakukan kueri hitung pada
departures_df, sambil mencatat berapa lama operasi berlangsung. - Hitung kembali baris-barisnya, sambil mencatat perbedaan waktu pada DataFrame yang telah di-cache.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))