Mulai sekarangMulai gratis

Kinerja impor file

Anda menerima sekumpulan data besar untuk diimpor ke dalam Spark DataFrame. Anda ingin menguji perbedaan kecepatan impor dengan membagi file tersebut.

Ada dua jenis file yang tersedia: departures_full.txt.gz dan departures_xxx.txt.gz di mana xxx adalah 000 - 013. Jumlah baris yang sama dibagi rata di setiap file.

Latihan ini merupakan bagian dari kursus

Membersihkan Data dengan PySpark

Lihat Kursus

Instruksi latihan

  • Impor file departures_full.txt.gz dan file departures_xxx.txt.gz ke dalam DataFrame terpisah.
  • Jalankan count pada setiap DataFrame dan bandingkan waktu eksekusinya.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Edit dan Jalankan Kode