Začněte nyníZačněte zdarma

Hlubší příznaky

V předchozích cvičeních jsme ukázali, jak kombinací dvou příznaků vznikají užitečné doplňkové příznaky pro prediktivní model. V tomto cvičení vytvoříš „hlubší" příznaky sloučením vlivu tří proměnných do jedné. Potom ověříš, jestli složitější příznaky vždy znamenají lepší prediktory.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř nový příznak sečtením SQFTBELOWGROUND a SQFTABOVEGROUND a ulož výsledek do nového sloupce Total_SQFT
  • Pomocí Total_SQFT a BATHSTOTAL vytvoř další příznak BATHS_PER_1000SQFT. Nezapomeň převést Total_SQFT na tisíce
  • Pomocí describe() zjisti nové minimum, maximum a průměr nejnovějšího příznaku BATHS_PER_1000SQFT. Všimneš si něčeho zvláštního?
  • Vytvoř dva grafy jointplot() s hodnotami Total_SQFT a BATHS_PER_1000SQFT na ose \(x\) a SALESCLOSEPRICE na ose \(y\), abys zjistil/a, který příznak lépe odpovídá hodnotě R**2. Má tento složitější příznak silnější vztah s SALESCLOSEPRICE?

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])

# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()

# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()

# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
Upravit a spustit kód