EmpezarEmpieza gratis

Dividir y explotar

Poder tomar un campo compuesto como GARAGEDESCRIPTION y trabajarlo hasta convertirlo en algo útil es un proceso laborioso. Es útil entender desde el principio qué valor puedes obtener al expandirlo. En este ejemplo, convertiremos nuestra cadena en un array tipo lista, la explotaremos y luego inspeccionaremos los valores únicos.

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Importa las funciones necesarias split() y explode() de pyspark.sql.functions.
  • Usa split() para crear una nueva columna garage_list dividiendo df['GARAGEDESCRIPTION'] por ', ', que es una coma seguida de un espacio.
  • Crea un nuevo registro por cada valor en df['garage_list'] usando explode() y asígnalo a una nueva columna ex_garage_list.
  • Usa distinct() para obtener los valores únicos de ex_garage_list y haz show de las 100 primeras filas, truncándolas a 50 caracteres para mostrar los valores.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Editar y ejecutar código