1. Learn
  2. /
  3. Курси
  4. /
  5. Опрацювання ознак у PySpark

Connected

Вправа

Бакетизація

Якщо ви володієте житлом, для вас дуже важливо, чи має будинок 1, 2, 3 або 4 спальні. Але, як і з ванними кімнатами, після певної межі вже не так важливо, чи їх 7 чи 8. У цьому прикладі ми розглянемо, як визначити зручні порогові значення для групування в бакети.

Інструкції

100 XP
  • Побудуйте графік розподілу для датафрейму pandas sample_df, використавши Seaborn distplot().
  • Оскільки видно довгий „хвіст" рідкісних значень після 5, створіть бакет splits для 1, 2, 3, 4, 5+.
  • Створіть перетворювач buck, ініціалізувавши Bucketizer() із цими межами для задання бакетів, потім вкажіть вхідну колонку BEDROOMS і вихідну колонку bedrooms.
  • Застосуйте перетворення Bucketizer до df за допомогою transform() і запишіть результат у df_bucket. Потім перевірте результати через show().