1. Learn
  2. /
  3. Курси
  4. /
  5. Очищення даних у PySpark

Connected

Вправа

Вилучення закоментованих рядків

Керівник просить вас виконати складний парсинг нового набору даних. Він містить анотації до набору ImageNet, але зосереджується саме на породах собак і їх ідентифікації на зображеннях. Перш ніж переходити до аналізу, потрібно прибрати кілька компонентів із некоректними або помилковими даними. Загальна схема документа невідома, тож ви хочете імпортувати рядки в один стовпець, щоб оперативно їх переглянути.

Спочатку потрібно вилучити всі закоментовані рядки в наборі даних.

Контекст spark і базовий CSV‑файл (annotations.csv.gz) уже доступні. Також доступна функція col.

Інструкції

100 XP
  • Імпортуйте файл annotations.csv.gz у DataFrame та підрахуйте кількість рядків. Укажіть символ розділювача |.
  • Дізнайтеся, скільки рядків починаються з #.
  • Імпортуйте файл ще раз у новий DataFrame, але вкажіть символ коментаря в параметрах, щоб вилучити закоментовані рядки.
  • Порахуйте рядки в новому DataFrame і перевірте, що різниця відповідає очікуваній.