Použití Corr()
Staré přísloví „korelace neznamená příčinnost" nás nabádá k opatrnosti. Přesto nám korelace dobře napoví, kde hledat slibné příznaky pro naše modely. V tomto cvičení si vyzkoušíš, jak procházet data a hledat v nich vzory poprvé.
Seznam columns s názvy sloupců je už připravený. Tvým úkolem je vypočítat korelaci mezi těmito sloupci a 'SALESCLOSEPRICE' a najít její maximum.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Pomocí cyklu
forprojdi všechny sloupce vcolumns. - V každé iteraci vypočítej korelaci mezi aktuálním sloupcem a
'SALESCLOSEPRICE'pomocí metodycorr(). - Přidej logiku, která průběžně aktualizuje nejvyšší zaznamenanou korelaci a název příslušného sloupce.
- Vypiš název sloupce s nejvyšší korelací s
'SALESCLOSEPRICE'.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)