Розбиття на стовпці
Ви суттєво почистили дані, видаливши некоректні рядки з датафрейму. Тепер потрібно виконати додаткові перетворення, згенерувавши окремі інформативні стовпці на основі вмісту датафрейму.
У вас є контекст spark і найновіша версія датафрейму annotations_df. pyspark.sql.functions доступний під псевдонімом F.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Розділіть вміст стовпця
'_c0'за символом табуляції та збережіть у зміннійsplit_cols. - Додайте такі стовпці на основі перших чотирьох елементів у змінній вище: folder, filename, width, height у датафрейм із назвою
split_df. - Додайте змінну
split_colsяк стовпець.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____