1. Learn
  2. /
  3. Courses
  4. /
  5. Очищення даних у PySpark

Connected

Exercise

Вилучення некоректних рядків

Тепер, коли ви успішно вилучили рядки з коментарями, ви отримали інформацію про загальний формат даних. У датафреймі має бути щонайменше 5 стовпців, розділених табуляцією. Пам'ятайте, що ваш початковий датафрейм має лише один стовпець, тож вам потрібно розбити дані за символом табуляції (\t).

Дані annotations_df уже доступні, а рядки з коментарями вилучені. Бібліотека spark.sql.functions доступна під псевдонімом F. Початкова кількість рядків у датафреймі збережена у змінній initial_count.

Instructions

100 XP
  • Створіть нову змінну tmp_fields, використавши стовпець '_c0' датафрейму annotations_df, розбивши його за символом табуляції.
  • Створіть у annotations_df новий стовпець з назвою 'colcount', що відображає кількість полів, визначених на попередньому кроці.
  • Відфільтруйте з annotations_df усі рядки, що містять менше ніж 5 полів.
  • Підрахуйте кількість рядків у датафреймі та порівняйте її з initial_count.