Kom igångKom igång gratis

Använda Corr()

Det gamla talesättet "Korrelation innebär inte kausalitet" är en nyttig påminnelse. Korrelation ger oss ändå en bra fingervisning om var vi bör börja leta efter lovande särdrag att använda i våra modeller. Använd den här övningen för att öva på att utforska din data för första gången och försöka hitta mönster.

En lista med namnet columns som innehåller kolumnnamn har redan skapats åt dig. I den här övningen beräknar du korrelationen mellan dessa kolumner och 'SALESCLOSEPRICE', och hittar det maximala värdet.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Använd en for-loop för att iterera genom columns.
  • Beräkna korrelationen mellan den aktuella kolumnen och 'SALESCLOSEPRICE' i varje iteration med hjälp av metoden corr().
  • Lägg till logik för att uppdatera den högsta observerade korrelationen och vilken kolumn den tillhör.
  • Skriv ut namnet på den kolumn som har den högsta korrelationen med 'SALESCLOSEPRICE'.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Redigera och kör kod