Використання Corr()
Стара настанова «Кореляція не дорівнює причинності» — корисне застереження. Водночас кореляція підказує, з чого варто почати пошук перспективних ознак для моделей. Скористайтеся цією вправою, щоб відчути, як уперше переглядати дані й шукати закономірності.
Для вас створено список columns з назвами стовпців. У цій вправі ви обчислите кореляцію між цими стовпцями та 'SALESCLOSEPRICE' і знайдете максимальну.
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Використайте цикл
for, щоб пройтися поcolumns. - У кожній ітерації обчисліть кореляцію між поточним стовпцем і
'SALESCLOSEPRICE'за допомогою методуcorr(). - Додайте логіку, щоб оновлювати максимальне спостережене значення кореляції та відповідний стовпець.
- Виведіть назву стовпця, який має найбільшу кореляцію з
'SALESCLOSEPRICE'.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)