Usar Corr()
El viejo dicho "La correlación no implica causalidad" es una advertencia útil. Aun así, la correlación sí nos orienta sobre por dónde empezar a buscar variables prometedoras para usar en nuestros modelos. Usa este ejercicio para familiarizarte con la exploración inicial de tus datos, intentando detectar patrones.
Se ha creado para ti una lista llamada columns con nombres de columnas. En este ejercicio calcularás la correlación entre esas columnas y 'SALESCLOSEPRICE', y buscarás el valor máximo.
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Usa un bucle
forpara iterar porcolumns. - En cada iteración, calcula la correlación entre la columna actual y
'SALESCLOSEPRICE'con el métodocorr(). - Crea la lógica para actualizar la correlación máxima observada y con qué columna se obtuvo.
- Imprime el nombre de la columna que tiene la correlación máxima con
'SALESCLOSEPRICE'.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)