ПочатиПочніть безкоштовно

Розбиття та вибух (explode)

Уміння взяти складене поле на кшталт GARAGEDESCRIPTION і перетворити його на щось корисне — це багатокроковий процес. Варто заздалегідь розуміти, яку користь дасть його розширення. У цьому прикладі ми перетворимо рядок на масив, подібний до списку, „вибухнемо" його, а потім розглянемо унікальні значення.

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте потрібні функції split() і explode() з pyspark.sql.functions.
  • Використайте split(), щоб створити новий стовпець garage_list, розбивши df['GARAGEDESCRIPTION'] за ', ' — це кома та пробіл.
  • Створіть новий запис для кожного значення в df['garage_list'], використовуючи explode(), і запишіть результат у новий стовпець ex_garage_list.
  • Застосуйте distinct(), щоб отримати унікальні значення ex_garage_list, і викличте show для перших 100 рядків, обрізавши їх до 50 символів, щоб зручно відобразити значення.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Редагувати та запускати код