EmpezarEmpieza gratis

Eliminar una lista de columnas

Nuestro conjunto de datos es muy rico en características, pero no todas aportan valor. Hay muchas que serán difíciles de transformar en algo útil. Por ahora, vamos a quitar cualquier columna que no sea inmediatamente útil eliminándolas.

  • 'STREETNUMBERNUMERIC': El número de la dirección postal de la vivienda
  • 'FIREPLACES': Número de chimeneas en la vivienda
  • 'LOTSIZEDIMENSIONS': Texto libre que describe la forma de la parcela
  • 'LISTTYPE': Conjunto de valores del tipo de venta
  • 'ACRES': Superficie numérica del tamaño de la parcela

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Lee la lista de descripciones de columnas de arriba y explora sus 30 valores principales con show(). El dataframe ya está filtrado a las columnas indicadas como df.
  • Crea una lista con dos columnas para eliminar, basada en su falta de relevancia para predecir los precios de vivienda, y llámala cols_to_drop. Recuerda que los ordenadores solo interpretan números de forma explícita y no entienden el contexto.
  • Usa la función drop() para quitar del dataframe df las columnas de la lista cols_to_drop.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Editar y ejecutar código