ÎncepețiÎncepe gratuit

Folosirea funcției Corr()

Zicala „Corelația nu implică cauzalitatea" este un avertisment util. Cu toate acestea, corelația ne oferă un punct de plecare bun pentru a identifica atributele promițătoare pe care să le folosim în modelele noastre. Folosește acest exercițiu pentru a explora datele pentru prima dată și a căuta tipare.

O listă numită columns, care conține numele coloanelor, a fost creată pentru tine. În acest exercițiu vei calcula corelația dintre acele coloane și 'SALESCLOSEPRICE', apoi vei găsi valoarea maximă.

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește o buclă for pentru a itera prin columns.
  • În fiecare ciclu al buclei, calculează corelația dintre coloana curentă și 'SALESCLOSEPRICE' folosind metoda corr().
  • Creează logica necesară pentru a actualiza corelația maximă observată și coloana căreia îi corespunde.
  • Afișează numele coloanei care are corelația maximă cu 'SALESCLOSEPRICE'.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Editează și rulează codul