Características más profundas
En ejercicios anteriores vimos cómo combinar dos características puede generar buenas características adicionales para un modelo predictivo. En este ejercicio, generarás características "más profundas" al combinar el efecto de tres variables en una sola. Luego comprobarás si las características más profundas y complejas siempre producen mejores predictores.
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Crea una nueva característica sumando
SQFTBELOWGROUNDySQFTABOVEGROUNDy creando una nueva columnaTotal_SQFT - Usando
Total_SQFT, crea otra característica llamadaBATHS_PER_1000SQFTconBATHSTOTAL. Asegúrate de escalarTotal_SQFTa miles - Usa
describe()para inspeccionar el nuevo mínimo, máximo y media de nuestra característica más recienteBATHS_PER_1000SQFT. ¿Notas algo extraño? - Crea dos
jointplots()conTotal_SQFTyBATHS_PER_1000SQFTcomo valores de \(x\) ySALESCLOSEPRICEcomo valor de $ypara ver cuál tiene el mejor ajuste R**2. ¿Esta característica más complicada tiene una relación más fuerte conSALESCLOSEPRICE`?
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])
# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()
# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()
# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()