Zacznij terazZacznij za darmo

Użycie Corr()

Stare powiedzenie „Korelacja nie oznacza przyczynowości" to ważne ostrzeżenie. Korelacja daje nam jednak dobry punkt wyjścia do szukania obiecujących cech do wykorzystania w modelach. W tym ćwiczeniu poczujesz, jak po raz pierwszy przeglądać dane w poszukiwaniu wzorców.

Przygotowano dla ciebie listę columns zawierającą nazwy kolumn. Oblicz korelację między tymi kolumnami a 'SALESCLOSEPRICE' i znajdź jej maksimum.

To ćwiczenie jest częścią kursu

Inżynieria cech z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj pętli for, aby przejść przez wszystkie elementy listy columns.
  • W każdej iteracji oblicz korelację między bieżącą kolumną a 'SALESCLOSEPRICE' za pomocą metody corr().
  • Dodaj logikę aktualizującą maksymalną zaobserwowaną korelację oraz nazwę odpowiadającej jej kolumny.
  • Wypisz nazwę kolumny, która ma najwyższą korelację z 'SALESCLOSEPRICE'.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Edytuj i uruchom kod