EmpezarEmpieza gratis

Usar Corr()

El viejo dicho "La correlación no implica causalidad" es una advertencia útil. Aun así, la correlación sí nos orienta sobre por dónde empezar a buscar variables prometedoras para usar en nuestros modelos. Usa este ejercicio para familiarizarte con la exploración inicial de tus datos, intentando detectar patrones.

Se ha creado para ti una lista llamada columns con nombres de columnas. En este ejercicio calcularás la correlación entre esas columnas y 'SALESCLOSEPRICE', y buscarás el valor máximo.

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Usa un bucle for para iterar por columns.
  • En cada iteración, calcula la correlación entre la columna actual y 'SALESCLOSEPRICE' con el método corr().
  • Crea la lógica para actualizar la correlación máxima observada y con qué columna se obtuvo.
  • Imprime el nombre de la columna que tiene la correlación máxima con 'SALESCLOSEPRICE'.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
Editar y ejecutar código