Začněte nyníZačněte zdarma

Použití Corr()

Staré přísloví „korelace neznamená příčinnost" nás nabádá k opatrnosti. Přesto nám korelace dobře napoví, kde hledat slibné příznaky pro naše modely. V tomto cvičení si vyzkoušíš, jak procházet data a hledat v nich vzory poprvé.

Seznam columns s názvy sloupců je už připravený. Tvým úkolem je vypočítat korelaci mezi těmito sloupci a 'SALESCLOSEPRICE' a najít její maximum.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Pomocí cyklu for projdi všechny sloupce v columns.
  • V každé iteraci vypočítej korelaci mezi aktuálním sloupcem a 'SALESCLOSEPRICE' pomocí metody corr().
  • Přidej logiku, která průběžně aktualizuje nejvyšší zaznamenanou korelaci a název příslušného sloupce.
  • Vypiš název sloupce s nejvyšší korelací s 'SALESCLOSEPRICE'.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Upravit a spustit kód