НачатьНачать бесплатно

Разбиение на столбцы

Вы значительно очистили данные, удалив недопустимые строки из DataFrame. Теперь нужно выполнить дополнительные преобразования: создать конкретные информативные столбцы на основе содержимого DataFrame.

Вам доступны контекст spark и актуальная версия DataFrame annotations_df. Библиотека pyspark.sql.functions подключена под псевдонимом F.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Разбейте содержимое столбца '_c0' по символу табуляции и сохраните результат в переменную split_cols.
  • Добавьте следующие столбцы на основе первых четырёх элементов переменной выше: folder, filename, width, height — в DataFrame с именем split_df.
  • Добавьте переменную split_cols как отдельный столбец.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Редактировать и запускать код