LoslegenKostenlos starten

corr() verwenden

Das alte Sprichwort „Korrelation impliziert keine Kausalität“ ist eine wichtige Warnung. Dennoch gibt uns Korrelation einen guten Hinweis, wo wir mit der Suche nach vielversprechenden Features für unsere Modelle anfangen sollten. Nutze diese Übung, um ein Gefühl dafür zu bekommen, dein Data zum ersten Mal zu durchsuchen und Muster zu finden.

Eine Liste namens columns mit Spaltennamen wurde für dich erstellt. In dieser Übung berechnest du die Korrelation zwischen diesen Spalten und 'SALESCLOSEPRICE' und ermittelst das Maximum.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Verwende eine for-Schleife, um durch columns zu iterieren.
  • Berechne in jedem Schleifendurchlauf die Korrelation zwischen der aktuellen Spalte und 'SALESCLOSEPRICE' mit der Methode corr().
  • Erstelle Logik, um die maximal beobachtete Korrelation und die zugehörige Spalte zu aktualisieren.
  • Gib den Namen der Spalte aus, die die höchste Korrelation mit 'SALESCLOSEPRICE' hat.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Code bearbeiten und ausführen