Dividir y explotar
Poder tomar un campo compuesto como GARAGEDESCRIPTION y trabajarlo hasta convertirlo en algo útil es un proceso laborioso. Es útil entender desde el principio qué valor puedes obtener al expandirlo. En este ejemplo, convertiremos nuestra cadena en un array tipo lista, la explotaremos y luego inspeccionaremos los valores únicos.
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Importa las funciones necesarias
split()yexplode()depyspark.sql.functions. - Usa
split()para crear una nueva columnagarage_listdividiendodf['GARAGEDESCRIPTION']por ', ', que es una coma seguida de un espacio. - Crea un nuevo registro por cada valor en
df['garage_list']usandoexplode()y asígnalo a una nueva columnaex_garage_list. - Usa
distinct()para obtener los valores únicos deex_garage_listy hazshowde las 100 primeras filas, truncándolas a 50 caracteres para mostrar los valores.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)