Tách thành các cột
Bạn đã làm sạch dữ liệu đáng kể bằng cách loại bỏ các hàng không hợp lệ khỏi DataFrame. Bây giờ bạn muốn tiếp tục biến đổi dữ liệu bằng cách tạo ra các cột có ý nghĩa cụ thể dựa trên nội dung của DataFrame.
Bạn đã có ngữ cảnh spark và phiên bản mới nhất của DataFrame annotations_df. pyspark.sql.functions có sẵn với bí danh F.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với PySpark
Hướng dẫn bài tập
- Tách nội dung cột
'_c0'theo ký tự tab và lưu vào biếnsplit_cols. - Thêm các cột sau dựa trên bốn phần tử đầu tiên trong biến trên: folder, filename, width, height vào một DataFrame tên
split_df. - Thêm biến
split_colsnhư một cột.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____