Aan de slagBegin gratis

Splitsen & exploderen

Een samengesteld veld zoals GARAGEDESCRIPTION omzetten naar iets bruikbaars kost wat stappen. Het is handig om vroeg te snappen welke waarde je kunt halen uit het uitbreiden ervan. In dit voorbeeld zetten we onze string om naar een lijstachtige array, exploderen die en bekijken we vervolgens de unieke waarden.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Importeer de benodigde functies split() en explode() uit pyspark.sql.functions
  • Gebruik split() om een nieuwe kolom garage_list te maken door df['GARAGEDESCRIPTION'] te splitsen op ', ', dus een komma gevolgd door een spatie.
  • Maak een nieuw record voor elke waarde in df['garage_list'] met explode() en geef die de nieuwe kolomnaam ex_garage_list
  • Gebruik distinct() om de unieke waarden van ex_garage_list op te halen en show de eerste 100 rijen, en kap ze af op 50 tekens om de waarden leesbaar te tonen.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Code bewerken en uitvoeren