Eliminar una lista de columnas
Nuestro conjunto de datos es muy rico en características, pero no todas aportan valor. Hay muchas que serán difíciles de transformar en algo útil. Por ahora, vamos a quitar cualquier columna que no sea inmediatamente útil eliminándolas.
'STREETNUMBERNUMERIC': El número de la dirección postal de la vivienda'FIREPLACES': Número de chimeneas en la vivienda'LOTSIZEDIMENSIONS': Texto libre que describe la forma de la parcela'LISTTYPE': Conjunto de valores del tipo de venta'ACRES': Superficie numérica del tamaño de la parcela
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Lee la lista de descripciones de columnas de arriba y explora sus 30 valores principales con
show(). El dataframe ya está filtrado a las columnas indicadas comodf. - Crea una lista con dos columnas para eliminar, basada en su falta de relevancia para predecir los precios de vivienda, y llámala
cols_to_drop. Recuerda que los ordenadores solo interpretan números de forma explícita y no entienden el contexto. - Usa la función
drop()para quitar del dataframedflas columnas de la listacols_to_drop.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)