ID với số phân vùng khác nhau
Bạn vừa hoàn thành việc thêm một trường ID vào DataFrame. Bây giờ, hãy xem điều gì xảy ra khi bạn làm điều tương tự trên các DataFrame có số lượng phân vùng khác nhau.
Để kiểm tra số phân vùng, dùng phương thức .rdd.getNumPartitions() trên một DataFrame.
Phiên làm việc spark và hai DataFrame, voter_df và voter_df_single, đã có sẵn trong không gian làm việc của bạn. Phần hướng dẫn sẽ giúp bạn khám phá sự khác biệt giữa các DataFrame. Thư viện pyspark.sql.functions có sẵn với bí danh F.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với PySpark
Hướng dẫn bài tập
- In ra số phân vùng của mỗi DataFrame.
- Thêm một trường
ROW_IDvào mỗi DataFrame. - Hiển thị 10 ID đầu tiên trong mỗi DataFrame.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)
# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____
# Show the top 10 IDs in each DataFrame
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)