Xác thực các hàng qua phép join
Một cách khác để lọc dữ liệu là dùng phép join để loại bỏ các bản ghi không hợp lệ. Bạn sẽ cần kiểm tra xem tên thư mục có đúng như mong đợi dựa trên DataFrame valid_folders_df đã cho. DataFrame split_df vẫn như lúc bạn để lại, với một nhóm các cột đã tách.
Đối tượng spark đã sẵn có, và pyspark.sql.functions đã được import với tên F.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với PySpark
Hướng dẫn bài tập
- Đổi tên cột
_c0thànhfoldertrên DataFramevalid_folders_df. - Đếm số hàng trong
split_df. - Join hai DataFrame theo tên thư mục và đặt DataFrame kết quả là
joined_df. Hãy nhớ broadcast DataFrame nhỏ hơn. - Kiểm tra số hàng còn lại trong DataFrame và so sánh.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))