EmpezarEmpieza gratis

Características más profundas

En ejercicios anteriores vimos cómo combinar dos características puede generar buenas características adicionales para un modelo predictivo. En este ejercicio, generarás características "más profundas" al combinar el efecto de tres variables en una sola. Luego comprobarás si las características más profundas y complejas siempre producen mejores predictores.

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Crea una nueva característica sumando SQFTBELOWGROUND y SQFTABOVEGROUND y creando una nueva columna Total_SQFT
  • Usando Total_SQFT, crea otra característica llamada BATHS_PER_1000SQFT con BATHSTOTAL. Asegúrate de escalar Total_SQFT a miles
  • Usa describe() para inspeccionar el nuevo mínimo, máximo y media de nuestra característica más reciente BATHS_PER_1000SQFT. ¿Notas algo extraño?
  • Crea dos jointplots() con Total_SQFT y BATHS_PER_1000SQFT como valores de \(x\) y SALESCLOSEPRICE como valor de $ypara ver cuál tiene el mejor ajuste R**2. ¿Esta característica más complicada tiene una relación más fuerte conSALESCLOSEPRICE`?

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])

# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()

# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()

# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
Editar y ejecutar código