1. Learn
  2. /
  3. Курси
  4. /
  5. Опрацювання ознак у PySpark

Connected

Вправа

Pivot і Join

Уміння «розгортати» (explode) та робити «зведення» (pivot) складеного поля — це чудово, але після цього ви отримуєте датафрейм лише з тими зведеними значеннями. Щоб це було справді корисно, потрібно знову приєднати його до початкового набору даних. Після з'єднання з'явиться багато значень NULL у щойно створених стовпцях. Оскільки ми знаємо контекст їх створення, можемо безпечно заповнити їх нулями: атрибут або є, або його немає.

Інструкції

100 XP
  • Зробіть pivot значень ex_garage_list, згрупувавши за ідентифікатором запису NO за допомогою groupBy(). Використайте наданий код, щоб агрегувати constant_val, ігноруючи null, та взяти перше значення.
  • Виконайте ліве з'єднання piv_df з df, використовуючи NO як умову з'єднання.
  • Створіть список стовпців zfill_cols для заповнення нулями, використавши атрибут columns у piv_df.
  • Заповніть нулями стовпці зведеного датафрейму zfill_cols, застосувавши fillna() із параметром subset.