Začněte nyníZačněte zdarma

Rozdělení a rozbalení hodnot

Práce se složeným polem jako GARAGEDESCRIPTION a jeho přeměna na něco užitečného je vícekrokový proces. Vyplatí se nejdříve zjistit, jakou hodnotu z jeho rozbalení získáš. V tomto příkladu převedeme řetězec na pole (array), rozbalíme ho a prohlédneme si unikátní hodnoty.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Importuj funkce split() a explode() z modulu pyspark.sql.functions.
  • Pomocí split() vytvoř nový sloupec garage_list rozdělením df['GARAGEDESCRIPTION'] podle ', ' (čárka a mezera).
  • Pomocí explode() vytvoř nový záznam pro každou hodnotu v df['garage_list'] a ulož výsledek do nového sloupce ex_garage_list.
  • Použij distinct() k získání unikátních hodnot sloupce ex_garage_list a zobraz prvních 100 řádků pomocí show, přičemž každý řádek zkrať na 50 znaků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Upravit a spustit kód