Splitting & Exploding
Preluarea unui câmp compus precum GARAGEDESCRIPTION și transformarea lui în ceva util este un proces care implică mai mulți pași. Este bine să înțelegi de la început ce valoare poți obține din extinderea acestuia. În acest exemplu, vom converti șirul de caractere într-un array de tip listă, îl vom exploda și apoi vom inspecta valorile unice.
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Importă funcțiile necesare
split()șiexplode()dinpyspark.sql.functions - Folosește
split()pentru a crea o nouă coloanăgarage_list, împărținddf['GARAGEDESCRIPTION']după', '– adică o virgulă urmată de un spațiu. - Creează o înregistrare nouă pentru fiecare valoare din
df['garage_list']folosindexplode()și atribuie-o unei noi coloaneex_garage_list - Folosește
distinct()pentru a obține valorile unice ale coloaneiex_garage_listși afișează primele 100 de rânduri cushow, trunchindu-le la 50 de caractere.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)