ПочатиПочніть безкоштовно

Розбиття на стовпці

Ви суттєво почистили дані, видаливши некоректні рядки з датафрейму. Тепер потрібно виконати додаткові перетворення, згенерувавши окремі інформативні стовпці на основі вмісту датафрейму.

У вас є контекст spark і найновіша версія датафрейму annotations_df. pyspark.sql.functions доступний під псевдонімом F.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Розділіть вміст стовпця '_c0' за символом табуляції та збережіть у змінній split_cols.
  • Додайте такі стовпці на основі перших чотирьох елементів у змінній вище: folder, filename, width, height у датафрейм із назвою split_df.
  • Додайте змінну split_cols як стовпець.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Редагувати та запускати код