Djupare särdrag
I tidigare övningar såg vi hur man kan kombinera två särdrag för att skapa användbara ytterligare särdrag till en prediktiv modell. I den här övningen skapar du 'djupare' särdrag genom att kombinera tre variablers effekter till ett. Sedan undersöker du om djupare och mer komplexa särdrag alltid ger bättre prediktorer.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Skapa ett nytt särdrag genom att addera
SQFTBELOWGROUNDochSQFTABOVEGROUNDoch spara resultatet i en ny kolumn,Total_SQFT - Använd
Total_SQFTför att skapa ytterligare ett särdrag kallatBATHS_PER_1000SQFTmed hjälp avBATHSTOTAL. Se till att skalaTotal_SQFTtill tusental - Använd
describe()för att inspektera det nya minimivärdet, maxvärdet och medelvärdet för det senaste särdragenBATHS_PER_1000SQFT. Märker du något märkligt? - Skapa två
jointplots()medTotal_SQFTrespektiveBATHS_PER_1000SQFTsom \(x\)-värden ochSALESCLOSEPRICEsom \(y\)-värde för att se vilket som ger bäst R**2-anpassning. Har det mer komplicerade särdragen ett starkare samband medSALESCLOSEPRICE?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])
# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()
# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()
# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()