Rozdělení a rozbalení hodnot
Práce se složeným polem jako GARAGEDESCRIPTION a jeho přeměna na něco užitečného je vícekrokový proces. Vyplatí se nejdříve zjistit, jakou hodnotu z jeho rozbalení získáš. V tomto příkladu převedeme řetězec na pole (array), rozbalíme ho a prohlédneme si unikátní hodnoty.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Importuj funkce
split()aexplode()z modulupyspark.sql.functions. - Pomocí
split()vytvoř nový sloupecgarage_listrozdělenímdf['GARAGEDESCRIPTION']podle ', ' (čárka a mezera). - Pomocí
explode()vytvoř nový záznam pro každou hodnotu vdf['garage_list']a ulož výsledek do nového sloupceex_garage_list. - Použij
distinct()k získání unikátních hodnot sloupceex_garage_lista zobraz prvních 100 řádků pomocíshow, přičemž každý řádek zkrať na 50 znaků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)