Hlubší příznaky
V předchozích cvičeních jsme ukázali, jak kombinací dvou příznaků vznikají užitečné doplňkové příznaky pro prediktivní model. V tomto cvičení vytvoříš „hlubší" příznaky sloučením vlivu tří proměnných do jedné. Potom ověříš, jestli složitější příznaky vždy znamenají lepší prediktory.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Vytvoř nový příznak sečtením
SQFTBELOWGROUNDaSQFTABOVEGROUNDa ulož výsledek do nového sloupceTotal_SQFT - Pomocí
Total_SQFTaBATHSTOTALvytvoř další příznakBATHS_PER_1000SQFT. Nezapomeň převéstTotal_SQFTna tisíce - Pomocí
describe()zjisti nové minimum, maximum a průměr nejnovějšího příznakuBATHS_PER_1000SQFT. Všimneš si něčeho zvláštního? - Vytvoř dva grafy
jointplot()s hodnotamiTotal_SQFTaBATHS_PER_1000SQFTna ose \(x\) aSALESCLOSEPRICEna ose \(y\), abys zjistil/a, který příznak lépe odpovídá hodnotě R**2. Má tento složitější příznak silnější vztah sSALESCLOSEPRICE?
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])
# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()
# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()
# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()