Folosirea funcției Corr()
Zicala „Corelația nu implică cauzalitatea" este un avertisment util. Cu toate acestea, corelația ne oferă un punct de plecare bun pentru a identifica atributele promițătoare pe care să le folosim în modelele noastre. Folosește acest exercițiu pentru a explora datele pentru prima dată și a căuta tipare.
O listă numită columns, care conține numele coloanelor, a fost creată pentru tine. În acest exercițiu vei calcula corelația dintre acele coloane și 'SALESCLOSEPRICE', apoi vei găsi valoarea maximă.
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Folosește o buclă
forpentru a itera princolumns. - În fiecare ciclu al buclei, calculează corelația dintre coloana curentă și
'SALESCLOSEPRICE'folosind metodacorr(). - Creează logica necesară pentru a actualiza corelația maximă observată și coloana căreia îi corespunde.
- Afișează numele coloanei care are corelația maximă cu
'SALESCLOSEPRICE'.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)