Diferencias
Vamos a explorar cómo generar variables a partir de las existentes. En el medio oeste de EE. UU., muchas viviendas unifamiliares tienen terreno adicional alrededor como zona verde. En este ejemplo, crearás una nueva característica llamada 'YARD_SIZE' y comprobarás si está correlacionada con nuestra variable objetivo.
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Crea una nueva columna con
withColumn()llamadaLOT_SIZE_SQFTy convierteACRESa pies cuadrados multiplicando poracres_to_sqfeet, el factor de conversión. - Crea otra columna nueva llamada
YARD_SIZErestandoFOUNDATIONSIZEdeLOT_SIZE_SQFT. - Ejecuta
corr()para cada una de las variables independientesYARD_SIZE,FOUNDATIONSIZE,LOT_SIZE_SQFTfrente a la variable dependienteSALESCLOSEPRICE. ¿La nueva característica muestra una correlación más fuerte que cualquiera de sus componentes?
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)
# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])
# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))