ПочатиПочніть безкоштовно

Використання Corr()

Стара настанова «Кореляція не дорівнює причинності» — корисне застереження. Водночас кореляція підказує, з чого варто почати пошук перспективних ознак для моделей. Скористайтеся цією вправою, щоб відчути, як уперше переглядати дані й шукати закономірності.

Для вас створено список columns з назвами стовпців. У цій вправі ви обчислите кореляцію між цими стовпцями та 'SALESCLOSEPRICE' і знайдете максимальну.

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Використайте цикл for, щоб пройтися по columns.
  • У кожній ітерації обчисліть кореляцію між поточним стовпцем і 'SALESCLOSEPRICE' за допомогою методу corr().
  • Додайте логіку, щоб оновлювати максимальне спостережене значення кореляції та відповідний стовпець.
  • Виведіть назву стовпця, який має найбільшу кореляцію з 'SALESCLOSEPRICE'.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Редагувати та запускати код