Tối ưu hiệu năng nhập tệp
Bạn được giao một bộ dữ liệu lớn để nhập vào một Spark DataFrame. Bạn muốn kiểm thử sự khác biệt về tốc độ nhập bằng cách tách nhỏ tệp.
Bạn có hai loại tệp: departures_full.txt.gz và departures_xxx.txt.gz trong đó xxx là từ 000 - 013. Số lượng dòng được chia đều giữa các tệp.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với PySpark
Hướng dẫn bài tập
- Nhập tệp
departures_full.txt.gzvà các tệpdepartures_xxx.txt.gzvào các DataFrame riêng biệt. - Chạy phép đếm trên mỗi DataFrame và so sánh thời gian chạy.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))