Inizia subitoInizia gratis

Caratteristiche più profonde

Negli esercizi precedenti abbiamo visto come combinare due feature possa creare ottime feature aggiuntive per un modello predittivo. In questo esercizio genererai feature "più profonde" combinando gli effetti di tre variabili in una sola. Poi verificherai se feature più profonde e complicate portano sempre a predittori migliori.

Questo esercizio fa parte del corso

Feature Engineering con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Crea una nuova feature sommando SQFTBELOWGROUND e SQFTABOVEGROUND e creando una nuova colonna Total_SQFT
  • Usando Total_SQFT, crea un’ulteriore feature chiamata BATHS_PER_1000SQFT con BATHSTOTAL. Assicurati di scalare Total_SQFT a migliaia
  • Usa describe() per ispezionare i nuovi min, max e mean della nostra feature più recente BATHS_PER_1000SQFT. Noti qualcosa di strano?
  • Crea due jointplots() con Total_SQFT e BATHS_PER_1000SQFT come valori \(x\) e SALESCLOSEPRICE come valore \(y\) per vedere quale ha il fit R**2 migliore. Questa feature più complicata ha una relazione più forte con SALESCLOSEPRICE?

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])

# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()

# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()

# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
Modifica ed esegui il codice