Bắt đầu ngayBắt đầu miễn phí

Tối ưu hiệu năng nhập tệp

Bạn được giao một bộ dữ liệu lớn để nhập vào một Spark DataFrame. Bạn muốn kiểm thử sự khác biệt về tốc độ nhập bằng cách tách nhỏ tệp.

Bạn có hai loại tệp: departures_full.txt.gzdepartures_xxx.txt.gz trong đó xxx là từ 000 - 013. Số lượng dòng được chia đều giữa các tệp.

Bài tập này là một phần của khóa học

Làm sạch dữ liệu với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Nhập tệp departures_full.txt.gz và các tệp departures_xxx.txt.gz vào các DataFrame riêng biệt.
  • Chạy phép đếm trên mỗi DataFrame và so sánh thời gian chạy.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Chỉnh sửa và Chạy Mã