Inizia subitoInizia gratis

Uso di Corr()

Il vecchio adagio "La correlazione non implica causalità" è un avvertimento importante. Tuttavia, la correlazione ci dà un buon indizio su dove iniziare a cercare le caratteristiche promettenti da usare nei nostri modelli. Usa questo esercizio per prendere confidenza con l'esplorazione iniziale dei tuoi dati, cercando di individuare dei pattern.

Per te è stata creata una lista chiamata columns contenente i nomi delle colonne. In questo esercizio calcolerai la correlazione tra quelle colonne e 'SALESCLOSEPRICE', e troverai il valore massimo.

Questo esercizio fa parte del corso

Feature Engineering con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Usa un ciclo for per iterare su columns.
  • In ogni iterazione, calcola la correlazione tra la colonna corrente e 'SALESCLOSEPRICE' usando il metodo corr().
  • Crea una logica per aggiornare la correlazione massima osservata e la colonna corrispondente.
  • Stampa il nome della colonna che ha la correlazione massima con 'SALESCLOSEPRICE'.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Modifica ed esegui il codice