Розбиття та вибух (explode)
Уміння взяти складене поле на кшталт GARAGEDESCRIPTION і перетворити його на щось корисне — це багатокроковий процес. Варто заздалегідь розуміти, яку користь дасть його розширення. У цьому прикладі ми перетворимо рядок на масив, подібний до списку, „вибухнемо" його, а потім розглянемо унікальні значення.
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Імпортуйте потрібні функції
split()іexplode()зpyspark.sql.functions. - Використайте
split(), щоб створити новий стовпецьgarage_list, розбившиdf['GARAGEDESCRIPTION']за ', ' — це кома та пробіл. - Створіть новий запис для кожного значення в
df['garage_list'], використовуючиexplode(), і запишіть результат у новий стовпецьex_garage_list. - Застосуйте
distinct(), щоб отримати унікальні значенняex_garage_list, і викличтеshowдля перших 100 рядків, обрізавши їх до 50 символів, щоб зручно відобразити значення.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)