corr() verwenden
Das alte Sprichwort „Korrelation impliziert keine Kausalität“ ist eine wichtige Warnung. Dennoch gibt uns Korrelation einen guten Hinweis, wo wir mit der Suche nach vielversprechenden Features für unsere Modelle anfangen sollten. Nutze diese Übung, um ein Gefühl dafür zu bekommen, dein Data zum ersten Mal zu durchsuchen und Muster zu finden.
Eine Liste namens columns mit Spaltennamen wurde für dich erstellt. In dieser Übung berechnest du die Korrelation zwischen diesen Spalten und 'SALESCLOSEPRICE' und ermittelst das Maximum.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Verwende eine
for-Schleife, um durchcolumnszu iterieren. - Berechne in jedem Schleifendurchlauf die Korrelation zwischen der aktuellen Spalte und
'SALESCLOSEPRICE'mit der Methodecorr(). - Erstelle Logik, um die maximal beobachtete Korrelation und die zugehörige Spalte zu aktualisieren.
- Gib den Namen der Spalte aus, die die höchste Korrelation mit
'SALESCLOSEPRICE'hat.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)