ПочатиПочніть безкоштовно

Відмінності

Дослідимо, як генерувати ознаки на основі наявних. На Середньому Заході США багато односімейних будинків мають додаткову ділянку землі для озеленення. У цьому прикладі ви створите нову ознаку під назвою 'YARD_SIZE', а потім перевірите, чи корелює ця ознака зі змінною результату.

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Створіть новий стовпець за допомогою withColumn() під назвою LOT_SIZE_SQFT і перетворіть ACRES на квадратні фути, помноживши на коефіцієнт перерахунку acres_to_sqfeet.
  • Створіть ще один стовпець під назвою YARD_SIZE, віднявши FOUNDATIONSIZE від LOT_SIZE_SQFT.
  • Запустіть corr() для кожної з незалежних змінних YARD_SIZE, FOUNDATIONSIZE, LOT_SIZE_SQFT проти залежної змінної SALESCLOSEPRICE. Чи показує нова ознака сильнішу кореляцію, ніж будь-яка з її складових?

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Редагувати та запускати код