Dela upp och expandera
Att ta ett sammansatt fält som GARAGEDESCRIPTION och omvandla det till något användbart är en process i flera steg. Det är bra att tidigt förstå vilket värde du kan få ut av att expandera det. I det här exemplet konverterar vi en sträng till en listliknande array, expanderar den och granskar sedan de unika värdena.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Importera funktionerna
split()ochexplode()frånpyspark.sql.functions - Använd
split()för att skapa en ny kolumngarage_listgenom att dela uppdf['GARAGEDESCRIPTION']på', '– det vill säga ett kommatecken följt av ett mellanslag. - Skapa en ny rad för varje värde i
df['garage_list']med hjälp avexplode()och tilldela den nya kolumnen namnetex_garage_list - Använd
distinct()för att hämta unika värden iex_garage_listoch visa de 100 första raderna medshow, med trunkering vid 50 tecken.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)