ПочатиПочніть безкоштовно

Видалення списку стовпців

Наш набір даних містить багато ознак, але не всі з них корисні. Є чимало таких, з якими буде складно працювати й отримати з них користь. Поки що приберімо стовпці, які не дають миттєвої користі, просто видаливши їх.

  • 'STREETNUMBERNUMERIC': Поштовий номер будинку за адресою
  • 'FIREPLACES': Кількість камінів у будинку
  • 'LOTSIZEDIMENSIONS': Вільний текст, що описує форму ділянки
  • 'LISTTYPE': Фіксований набір значень типу продажу
  • 'ACRES': Числова площа ділянки

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Прочитайте опис стовпців вище та дослідіть їхні топ-30 значень за допомогою show(). Датафрейм уже відфільтровано до цих стовпців і доступний як df.
  • Створіть список із двох стовпців для видалення через їхню нерелевантність до прогнозування цін на житло. Назвіть його cols_to_drop. Пам'ятайте, комп'ютери явно інтерпретують лише числа і не розуміють контекст.
  • Скористайтеся функцією drop(), щоб видалити стовпці зі списку cols_to_drop з датафрейму df.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Редагувати та запускати код