EmpezarEmpieza gratis

Diferencias

Vamos a explorar cómo generar variables a partir de las existentes. En el medio oeste de EE. UU., muchas viviendas unifamiliares tienen terreno adicional alrededor como zona verde. En este ejemplo, crearás una nueva característica llamada 'YARD_SIZE' y comprobarás si está correlacionada con nuestra variable objetivo.

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Crea una nueva columna con withColumn() llamada LOT_SIZE_SQFT y convierte ACRES a pies cuadrados multiplicando por acres_to_sqfeet, el factor de conversión.
  • Crea otra columna nueva llamada YARD_SIZE restando FOUNDATIONSIZE de LOT_SIZE_SQFT.
  • Ejecuta corr() para cada una de las variables independientes YARD_SIZE, FOUNDATIONSIZE, LOT_SIZE_SQFT frente a la variable dependiente SALESCLOSEPRICE. ¿La nueva característica muestra una correlación más fuerte que cualquiera de sus componentes?

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Lot size in square feet
acres_to_sqfeet = 43560
df = df.____(____, df[____] * ____)

# Create new column YARD_SIZE
df = df.____(____, df[____] - df[____])

# Corr of ACRES vs SALESCLOSEPRICE
print("Corr of ACRES vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE
print("Corr of FOUNDATIONSIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
# Corr of YARD_SIZE vs SALESCLOSEPRICE
print("Corr of YARD_SIZE vs SALESCLOSEPRICE: " + str(df.____(____, ____)))
Editar y ejecutar código