Corr() gebruiken
Het gezegde ‘correlatie impliceert geen causaliteit’ is een waarschuwing. Toch geeft correlatie een goede hint waar je moet beginnen met het zoeken naar veelbelovende features voor je modellen. Gebruik deze oefening om gevoel te krijgen voor het voor het eerst door je data zoeken en het opsporen van patronen.
Er is een lijst columns met kolomnamen voor je aangemaakt. In deze oefening bereken je de correlatie tussen die kolommen en 'SALESCLOSEPRICE', en zoek je de maximale waarde.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Gebruik een
for-lus om doorcolumnste itereren. - Bereken in elke iteratie de correlatie tussen de huidige kolom en
'SALESCLOSEPRICE'met de methodecorr(). - Bouw logica in om de maximaal waargenomen correlatie en bijbehorende kolom bij te werken.
- Print de naam van de kolom die de hoogste correlatie met
'SALESCLOSEPRICE'heeft.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)