1. Learn
  2. /
  3. Курси
  4. /
  5. Опрацювання ознак у PySpark

Connected

Вправа

Видалення записів за текстовими фільтрами

Корисно ставити клієнтам багато запитань і приділяти час розумінню своїх змінних. Ви з'ясували, що Assumable mortgage — рідкісне явище на ринку нерухомості, тож клієнт радить їх виключити. У цій вправі ми використаємо isin(), яка подібна до like(), але дозволяє передати список значень як фільтр, а не одне значення.

Інструкції

100 XP
  • Використайте select() і show(), щоб переглянути унікальні значення у стовпці 'ASSUMABLEMORTGAGE', і створіть список yes_values для всіх значень, що містять рядок 'Yes'.
  • Використайте ~df['ASSUMABLEMORTGAGE'], isin() та .isNull(), щоб створити заперечний (NOT) фільтр: вилучити записи, що містять відповідні значення зі списку yes_values, і залишити записи з null-значеннями. Збережіть цей фільтр у змінній text_filter.
  • Використайте where(), щоб застосувати text_filter до df.
  • Виведіть кількість записів, що залишилися в df.