Kinerja impor file
Anda menerima sekumpulan data besar untuk diimpor ke dalam Spark DataFrame. Anda ingin menguji perbedaan kecepatan impor dengan membagi file tersebut.
Ada dua jenis file yang tersedia: departures_full.txt.gz dan departures_xxx.txt.gz di mana xxx adalah 000 - 013. Jumlah baris yang sama dibagi rata di setiap file.
Latihan ini merupakan bagian dari kursus
Membersihkan Data dengan PySpark
Instruksi latihan
- Impor file
departures_full.txt.gzdan filedepartures_xxx.txt.gzke dalam DataFrame terpisah. - Jalankan count pada setiap DataFrame dan bandingkan waktu eksekusinya.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))