Caratteristiche più profonde
Negli esercizi precedenti abbiamo visto come combinare due feature possa creare ottime feature aggiuntive per un modello predittivo. In questo esercizio genererai feature "più profonde" combinando gli effetti di tre variabili in una sola. Poi verificherai se feature più profonde e complicate portano sempre a predittori migliori.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Crea una nuova feature sommando
SQFTBELOWGROUNDeSQFTABOVEGROUNDe creando una nuova colonnaTotal_SQFT - Usando
Total_SQFT, crea un’ulteriore feature chiamataBATHS_PER_1000SQFTconBATHSTOTAL. Assicurati di scalareTotal_SQFTa migliaia - Usa
describe()per ispezionare i nuovi min, max e mean della nostra feature più recenteBATHS_PER_1000SQFT. Noti qualcosa di strano? - Crea due
jointplots()conTotal_SQFTeBATHS_PER_1000SQFTcome valori \(x\) eSALESCLOSEPRICEcome valore \(y\) per vedere quale ha il fit R**2 migliore. Questa feature più complicata ha una relazione più forte conSALESCLOSEPRICE?
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])
# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()
# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()
# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()