Kom igångKom igång gratis

Dela upp och expandera

Att ta ett sammansatt fält som GARAGEDESCRIPTION och omvandla det till något användbart är en process i flera steg. Det är bra att tidigt förstå vilket värde du kan få ut av att expandera det. I det här exemplet konverterar vi en sträng till en listliknande array, expanderar den och granskar sedan de unika värdena.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Importera funktionerna split() och explode() från pyspark.sql.functions
  • Använd split() för att skapa en ny kolumn garage_list genom att dela upp df['GARAGEDESCRIPTION']', ' – det vill säga ett kommatecken följt av ett mellanslag.
  • Skapa en ny rad för varje värde i df['garage_list'] med hjälp av explode() och tilldela den nya kolumnen namnet ex_garage_list
  • Använd distinct() för att hämta unika värden i ex_garage_list och visa de 100 första raderna med show, med trunkering vid 50 tecken.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Redigera och kör kod