Видалення списку стовпців
Наш набір даних містить багато ознак, але не всі з них корисні. Є чимало таких, з якими буде складно працювати й отримати з них користь. Поки що приберімо стовпці, які не дають миттєвої користі, просто видаливши їх.
'STREETNUMBERNUMERIC': Поштовий номер будинку за адресою'FIREPLACES': Кількість камінів у будинку'LOTSIZEDIMENSIONS': Вільний текст, що описує форму ділянки'LISTTYPE': Фіксований набір значень типу продажу'ACRES': Числова площа ділянки
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Прочитайте опис стовпців вище та дослідіть їхні топ-30 значень за допомогою
show(). Датафрейм уже відфільтровано до цих стовпців і доступний якdf. - Створіть список із двох стовпців для видалення через їхню нерелевантність до прогнозування цін на житло. Назвіть його
cols_to_drop. Пам'ятайте, комп'ютери явно інтерпретують лише числа і не розуміють контекст. - Скористайтеся функцією
drop(), щоб видалити стовпці зі спискуcols_to_dropз датафреймуdf.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)