Разбиение на столбцы
Вы значительно очистили данные, удалив недопустимые строки из DataFrame. Теперь нужно выполнить дополнительные преобразования: создать конкретные информативные столбцы на основе содержимого DataFrame.
Вам доступны контекст spark и актуальная версия DataFrame annotations_df. Библиотека pyspark.sql.functions подключена под псевдонимом F.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Разбейте содержимое столбца
'_c0'по символу табуляции и сохраните результат в переменнуюsplit_cols. - Добавьте следующие столбцы на основе первых четырёх элементов переменной выше: folder, filename, width, height — в DataFrame с именем
split_df. - Добавьте переменную
split_colsкак отдельный столбец.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____