Kom igångKom igång gratis

Djupare särdrag

I tidigare övningar såg vi hur man kan kombinera två särdrag för att skapa användbara ytterligare särdrag till en prediktiv modell. I den här övningen skapar du 'djupare' särdrag genom att kombinera tre variablers effekter till ett. Sedan undersöker du om djupare och mer komplexa särdrag alltid ger bättre prediktorer.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa ett nytt särdrag genom att addera SQFTBELOWGROUND och SQFTABOVEGROUND och spara resultatet i en ny kolumn, Total_SQFT
  • Använd Total_SQFT för att skapa ytterligare ett särdrag kallat BATHS_PER_1000SQFT med hjälp av BATHSTOTAL. Se till att skala Total_SQFT till tusental
  • Använd describe() för att inspektera det nya minimivärdet, maxvärdet och medelvärdet för det senaste särdragen BATHS_PER_1000SQFT. Märker du något märkligt?
  • Skapa två jointplots() med Total_SQFT respektive BATHS_PER_1000SQFT som \(x\)-värden och SALESCLOSEPRICE som \(y\)-värde för att se vilket som ger bäst R**2-anpassning. Har det mer komplicerade särdragen ett starkare samband med SALESCLOSEPRICE?

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])

# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()

# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()

# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
Redigera och kör kod