Använda Corr()
Det gamla talesättet "Korrelation innebär inte kausalitet" är en nyttig påminnelse. Korrelation ger oss ändå en bra fingervisning om var vi bör börja leta efter lovande särdrag att använda i våra modeller. Använd den här övningen för att öva på att utforska din data för första gången och försöka hitta mönster.
En lista med namnet columns som innehåller kolumnnamn har redan skapats åt dig. I den här övningen beräknar du korrelationen mellan dessa kolumner och 'SALESCLOSEPRICE', och hittar det maximala värdet.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Använd en
for-loop för att iterera genomcolumns. - Beräkna korrelationen mellan den aktuella kolumnen och
'SALESCLOSEPRICE'i varje iteration med hjälp av metodencorr(). - Lägg till logik för att uppdatera den högsta observerade korrelationen och vilken kolumn den tillhör.
- Skriv ut namnet på den kolumn som har den högsta korrelationen med
'SALESCLOSEPRICE'.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)