Uso di Corr()
Il vecchio adagio "La correlazione non implica causalità" è un avvertimento importante. Tuttavia, la correlazione ci dà un buon indizio su dove iniziare a cercare le caratteristiche promettenti da usare nei nostri modelli. Usa questo esercizio per prendere confidenza con l'esplorazione iniziale dei tuoi dati, cercando di individuare dei pattern.
Per te è stata creata una lista chiamata columns contenente i nomi delle colonne. In questo esercizio calcolerai la correlazione tra quelle colonne e 'SALESCLOSEPRICE', e troverai il valore massimo.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Usa un ciclo
forper iterare sucolumns. - In ogni iterazione, calcola la correlazione tra la colonna corrente e
'SALESCLOSEPRICE'usando il metodocorr(). - Crea una logica per aggiornare la correlazione massima osservata e la colonna corrispondente.
- Stampa il nome della colonna che ha la correlazione massima con
'SALESCLOSEPRICE'.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)