Відмінності
Дослідимо, як генерувати ознаки на основі наявних. На Середньому Заході США багато односімейних будинків мають додаткову ділянку землі для озеленення. У цьому прикладі ви створите нову ознаку під назвою 'YARD_SIZE', а потім перевірите, чи корелює ця ознака зі змінною результату.
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Створіть новий стовпець за допомогою
withColumn()під назвоюLOT_SIZE_SQFTі перетворітьACRESна квадратні фути, помноживши на коефіцієнт перерахункуacres_to_sqfeet. - Створіть ще один стовпець під назвою
YARD_SIZE, віднявшиFOUNDATIONSIZEвідLOT_SIZE_SQFT. - Запустіть
corr()для кожної з незалежних зміннихYARD_SIZE,FOUNDATIONSIZE,LOT_SIZE_SQFTпроти залежної змінноїSALESCLOSEPRICE. Чи показує нова ознака сильнішу кореляцію, ніж будь-яка з її складових?
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)
# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])
# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))