Użycie Corr()
Stare powiedzenie „Korelacja nie oznacza przyczynowości" to ważne ostrzeżenie. Korelacja daje nam jednak dobry punkt wyjścia do szukania obiecujących cech do wykorzystania w modelach. W tym ćwiczeniu poczujesz, jak po raz pierwszy przeglądać dane w poszukiwaniu wzorców.
Przygotowano dla ciebie listę columns zawierającą nazwy kolumn. Oblicz korelację między tymi kolumnami a 'SALESCLOSEPRICE' i znajdź jej maksimum.
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Użyj pętli
for, aby przejść przez wszystkie elementy listycolumns. - W każdej iteracji oblicz korelację między bieżącą kolumną a
'SALESCLOSEPRICE'za pomocą metodycorr(). - Dodaj logikę aktualizującą maksymalną zaobserwowaną korelację oraz nazwę odpowiadającej jej kolumny.
- Wypisz nazwę kolumny, która ma najwyższą korelację z
'SALESCLOSEPRICE'.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)