Bắt đầu ngayBắt đầu miễn phí

Ghi cấu hình Spark

Sau khi bạn đã xem lại một số cấu hình Spark trên cụm, bạn muốn điều chỉnh một vài thiết lập để tối ưu Spark cho nhu cầu của mình. Bạn sẽ nhập một số dữ liệu để kiểm tra rằng các thay đổi đã tác động đến cụm.

Cấu hình Spark ban đầu được đặt ở giá trị mặc định là 200 partition.

Đối tượng spark đã sẵn sàng để sử dụng. Tệp departures.txt.gz có sẵn để import. Một DataFrame ban đầu chứa các dòng khác nhau (distinct) từ departures.txt.gz đã có sẵn với tên departures_df.

Bài tập này là một phần của khóa học

Làm sạch dữ liệu với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Lưu số lượng partition trong departures_df vào biến before.
  • Đổi cấu hình spark.sql.shuffle.partitions thành 500 partition.
  • Tạo lại DataFrame departures_df bằng cách đọc các dòng khác nhau (distinct) từ tệp departures.
  • In ra số lượng partition trước và sau khi thay đổi cấu hình.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Chỉnh sửa và Chạy Mã