Splitsen & exploderen
Een samengesteld veld zoals GARAGEDESCRIPTION omzetten naar iets bruikbaars kost wat stappen. Het is handig om vroeg te snappen welke waarde je kunt halen uit het uitbreiden ervan. In dit voorbeeld zetten we onze string om naar een lijstachtige array, exploderen die en bekijken we vervolgens de unieke waarden.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Importeer de benodigde functies
split()enexplode()uitpyspark.sql.functions - Gebruik
split()om een nieuwe kolomgarage_listte maken doordf['GARAGEDESCRIPTION']te splitsen op ', ', dus een komma gevolgd door een spatie. - Maak een nieuw record voor elke waarde in
df['garage_list']metexplode()en geef die de nieuwe kolomnaamex_garage_list - Gebruik
distinct()om de unieke waarden vanex_garage_listop te halen enshowde eerste 100 rijen, en kap ze af op 50 tekens om de waarden leesbaar te tonen.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)