Aan de slagBegin gratis

Corr() gebruiken

Het gezegde ‘correlatie impliceert geen causaliteit’ is een waarschuwing. Toch geeft correlatie een goede hint waar je moet beginnen met het zoeken naar veelbelovende features voor je modellen. Gebruik deze oefening om gevoel te krijgen voor het voor het eerst door je data zoeken en het opsporen van patronen.

Er is een lijst columns met kolomnamen voor je aangemaakt. In deze oefening bereken je de correlatie tussen die kolommen en 'SALESCLOSEPRICE', en zoek je de maximale waarde.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Gebruik een for-lus om door columns te itereren.
  • Bereken in elke iteratie de correlatie tussen de huidige kolom en 'SALESCLOSEPRICE' met de methode corr().
  • Bouw logica in om de maximaal waargenomen correlatie en bijbehorende kolom bij te werken.
  • Print de naam van de kolom die de hoogste correlatie met 'SALESCLOSEPRICE' heeft.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Code bewerken en uitvoeren