Ghi cấu hình Spark
Sau khi bạn đã xem lại một số cấu hình Spark trên cụm, bạn muốn điều chỉnh một vài thiết lập để tối ưu Spark cho nhu cầu của mình. Bạn sẽ nhập một số dữ liệu để kiểm tra rằng các thay đổi đã tác động đến cụm.
Cấu hình Spark ban đầu được đặt ở giá trị mặc định là 200 partition.
Đối tượng spark đã sẵn sàng để sử dụng. Tệp departures.txt.gz có sẵn để import. Một DataFrame ban đầu chứa các dòng khác nhau (distinct) từ departures.txt.gz đã có sẵn với tên departures_df.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với PySpark
Hướng dẫn bài tập
- Lưu số lượng partition trong
departures_dfvào biếnbefore. - Đổi cấu hình
spark.sql.shuffle.partitionsthành 500 partition. - Tạo lại DataFrame
departures_dfbằng cách đọc các dòng khác nhau (distinct) từ tệp departures. - In ra số lượng partition trước và sau khi thay đổi cấu hình.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)